محققان در مقالهای جدید، تکنیک فوقالعادهای به نام «CompilerKV» را معرفی کردهاند که مشکل محدودیت حافظه (KV Cache) در مدلهای زبانی بزرگ (LLM) را هدف قرار داده است.
🔹 این روش با استفاده از «تجربیات آفلاین»، سیاستهای فشردهسازی حافظه را به شکلی هوشمندانه تدوین میکند که برخلاف روشهای سنتی، نیازی به محاسبات سنگین و پرهزینه در زمان اجرا ندارد.
نتایج نشان میدهد که این روش نه تنها دقت مدل را در پردازشهای طولانی (Context Window) به طرز چشمگیری حفظ میکند، بلکه در تستهای استاندارد مثل LongBench و RULER، عملکرد بسیار بهتری نسبت به روشهای پیشین مانند SnapKV داشته است. این یعنی مدلهای آینده میتوانند متنهای بسیار طولانیتری را با سرعت و دقت بالاتر پردازش کنند! 🧠✨
سازی
منبع: arXiv AI
