آیا تا به حال به محدودیتهای حافظه (KV Cache) در مدلهای زبانی هنگام پردازش متنهای طولانی فکر کردهاید؟ محققان بهتازگی راهکار نوآورانهای به نام LOCKS معرفی کردهاند که انقلابی در دیکدینگ مدلهای بزرگ ایجاد میکند.
🔹 چرا LOCKS مهم است؟
این روش با استفاده از خلاصهسازیهای فشرده از حافظه، اجازه میدهد مدل فقط بخشهای حیاتی متن را بررسی کند. نتیجه چیست؟
✅ افزایش دو برابری سرعت (Latency) در متنهای بسیار طولانی (۱ میلیون توکن).
✅ حفظ دقت در سطح مدلهای کامل (FullKV) با استفاده از تنها ۲٪ توکنها.
✅ سازگاری کامل به عنوان یک افزونه (Plugin) برای vLLM.
این یعنی در آینده نزدیک، میتوانیم با هزینه کمتر و سرعت بسیار بالاتر، کتابهای چندصد صفحهای یا کدهای حجیم را با هوش مصنوعی تحلیل کنیم. یک گام بزرگ دیگر برای کاربردیتر کردن مدلهای هوش مصنوعی!
نویسی
منبع: arXiv Machine Learning
