محققان به تازگی چارچوب نوآورانهای به نام PEEK معرفی کردهاند که میتواند بازی را در اجرای مدلهای زبانی (LLM) تغییر دهد. این ابزار با مدیریت هوشمندانه و پیشدستانه «KV Cache» و استفاده از درختهای رادیکس برای شناسایی شباهتهای پیشفرض در درخواستها، سرعت تولید متن را به طرز چشمگیری افزایش میدهد.
نتایج آزمایشها روی vLLM و SGLang خیرهکننده است:
✅ تا ۷ برابر بهبود در TTFT (زمان اولین توکن)
✅ تا ۴ برابر افزایش در توان عملیاتی (Throughput)
✅ کاهش چشمگیر فشار بر حافظه در حین استنتاج
این یعنی در آینده نزدیک، چتباتها و سرویسهای مبتنی بر هوش مصنوعی میتوانند با هزینه کمتر و سرعت بسیار بالاتری به درخواستهای ما پاسخ دهند.
سازی
منبع: arXiv AI
