اجرای مدلهای زبانی بزرگ (LLM) روی دستگاههای لبه همیشه با چالش کمبود حافظه و سرعت پردازش مواجه بوده است. حالا محققان روش جدیدی به نام «GoQuant» معرفی کردهاند که با استفاده از یک رویکرد هندسی هوشمندانه، کوانتایز کردن (Quantization) مدلها را به شدت بهینه میکند.
ویژگیهای کلیدی این روش:
✅ حذف محاسبات ضرب سنگین و جایگزینی با عملیات شیفت بیتی (بسیار سریعتر و کممصرفتر)
✅ حل مشکل کاهش دقت در مدلهای زیر ۴ بیت
✅ سرعت خیرهکننده: کوانتایز کردن کامل مدل LLaMA-2-7B تنها در ۴.۴ دقیقه!
این فناوری راه را برای اجرای روانتر هوش مصنوعی روی گوشیها و دستگاههای کوچک بازتر میکند.
منبع: arXiv AI
