یکی از بزرگترین چالشهای استفاده از مدلهای زبانی بزرگ (LLM) در متنهای طولانی، مصرف سنگین حافظه و کاهش سرعت به دلیل «کش KV» (KV Cache) است. خبر خوب اینکه محققان روشی نوآورانه به نام FreqDepthKV معرفی کردهاند که به جای حذف اطلاعات، با هوشمندی لایههای مختلف را فشرده میکند.
ویژگیهای کلیدی این تکنیک:
✅ کاهش ۳.۹ برابری مصرف حافظه (Peak Memory)
✅ افزایش چشمگیر سرعت پاسخدهی (Throughput)
✅ حفظ دقت بالا در تحلیل متون طولانی و کدنویسی
✅ کاهش زمان اولین پاسخ (TTFT) به حدود ۲ ثانیه
این دستاورد میتواند راه را برای اجرای روانتر و ارزانتر هوش مصنوعی روی سیستمهای معمولی هموارتر کند. 🧠💻
سازی
منبع: arXiv AI
