🚀 بهینه‌سازی انقلابی مدل‌های هوش مصنوعی با GoQuant!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

اجرای مدل‌های زبانی بزرگ (LLM) روی دستگاه‌های لبه همیشه با چالش کمبود حافظه و سرعت پردازش مواجه بوده است. حالا محققان روش جدیدی به نام «GoQuant» معرفی کرده‌اند که با استفاده از یک رویکرد هندسی هوشمندانه، کوانتایز کردن (Quantization) مدل‌ها را به شدت بهینه می‌کند.

ویژگی‌های کلیدی این روش:
✅ حذف محاسبات ضرب سنگین و جایگزینی با عملیات شیفت بیتی (بسیار سریع‌تر و کم‌مصرف‌تر)
✅ حل مشکل کاهش دقت در مدل‌های زیر ۴ بیت
✅ سرعت خیره‌کننده: کوانتایز کردن کامل مدل LLaMA-2-7B تنها در ۴.۴ دقیقه!

این فناوری راه را برای اجرای روان‌تر هوش مصنوعی روی گوشی‌ها و دستگاه‌های کوچک بازتر می‌کند.

منبع: arXiv AI