🚀 جهش بزرگ در سرعت و کارایی مدل‌های زبانی با PEEK! ⚡️

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به تازگی چارچوب نوآورانه‌ای به نام PEEK معرفی کرده‌اند که می‌تواند بازی را در اجرای مدل‌های زبانی (LLM) تغییر دهد. این ابزار با مدیریت هوشمندانه و پیش‌دستانه «KV Cache» و استفاده از درخت‌های رادیکس برای شناسایی شباهت‌های پیش‌فرض در درخواست‌ها، سرعت تولید متن را به طرز چشمگیری افزایش می‌دهد.

نتایج آزمایش‌ها روی vLLM و SGLang خیره‌کننده است:
✅ تا ۷ برابر بهبود در TTFT (زمان اولین توکن)
✅ تا ۴ برابر افزایش در توان عملیاتی (Throughput)
✅ کاهش چشمگیر فشار بر حافظه در حین استنتاج

این یعنی در آینده نزدیک، چت‌بات‌ها و سرویس‌های مبتنی بر هوش مصنوعی می‌توانند با هزینه کمتر و سرعت بسیار بالاتری به درخواست‌های ما پاسخ دهند.

‌سازی

منبع: arXiv AI