یکی از چالشهای بزرگ در اجرای مدلهای زبانی (LLM)، مصرف بسیار بالای حافظه توسط «کش KV» است که سرعت و کارایی مدلها را محدود میکند. حالا محققان روش جدیدی به نام NSNQuant معرفی کردهاند که بدون نیاز به دادههای کالیبراسیون، این مشکل را حل میکند.
✨ ویژگیهای کلیدی NSNQuant:
✅ فشردهسازی هوشمند کش KV با تکنیک کوانتیزاسیون برداری.
✅ افزایش تا ۳ برابری سرعت (Throughput) نسبت به مدلهای معمول.
✅ عملکرد عالی حتی در تنظیمات ۱ یا ۲ بیتی.
✅ پیادهسازی ساده و بدون نیاز به مجموعهدادههای پیچیده برای کالیبره کردن.
این نوآوری گام بزرگی برای اجرای سریعتر و ارزانتر مدلهای هوش مصنوعی روی سیستمهای معمولی است. اگر توسعهدهنده هستید، کد این پروژه در گیتهاب در دسترس است.
سازی
منبع: arXiv AI
