🚀 بهینه‌سازی خیره‌کننده مدل‌های زبانی با روش NSNQuant!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از چالش‌های بزرگ در اجرای مدل‌های زبانی (LLM)، مصرف بسیار بالای حافظه توسط «کش KV» است که سرعت و کارایی مدل‌ها را محدود می‌کند. حالا محققان روش جدیدی به نام NSNQuant معرفی کرده‌اند که بدون نیاز به داده‌های کالیبراسیون، این مشکل را حل می‌کند.

✨ ویژگی‌های کلیدی NSNQuant:
✅ فشرده‌سازی هوشمند کش KV با تکنیک کوانتیزاسیون برداری.
✅ افزایش تا ۳ برابری سرعت (Throughput) نسبت به مدل‌های معمول.
✅ عملکرد عالی حتی در تنظیمات ۱ یا ۲ بیتی.
✅ پیاده‌سازی ساده و بدون نیاز به مجموعه‌داده‌های پیچیده برای کالیبره کردن.

این نوآوری گام بزرگی برای اجرای سریع‌تر و ارزان‌تر مدل‌های هوش مصنوعی روی سیستم‌های معمولی است. اگر توسعه‌دهنده هستید، کد این پروژه در گیت‌هاب در دسترس است.

‌سازی

منبع: arXiv AI