خبر خوب برای توسعهدهندگان مدلهای زبانی: محققان به تازگی مکانیسم جدیدی به نام «Keyless Attention» معرفی کردهاند که میتواند بازی را در مدیریت حافظه تغییر دهد.
📌 چرا این موضوع مهم است؟
یکی از بزرگترین چالشهای فعلی در اجرای مدلهای هوش مصنوعی (Inference)، حجم بالای حافظه مصرفی برای KV Cache در پردازش متنهای طولانی است. این تکنولوژی جدید با حذف «کلیدها» (Keys) و استفاده از یک مسیر اختصاصی برای مقادیر (Values)، موفق شده:
✅ مصرف حافظه KV Cache را تا ۵۰٪ کاهش دهد!
✅ سرعت بازخوانی و خروجی (Throughput) را افزایش دهد.
✅ عملکردی مشابه یا حتی بهتر از مدلهای استاندارد ارائه دهد.
این پیشرفت میتواند راه را برای اجرای مدلهای بسیار قدرتمندتر بر روی سختافزارهای محدودتر هموار کند. دنیای هوش مصنوعی هر روز بهینهتر از قبل میشود!
منبع: arXiv AI
