اگر در حوزه توسعه و اجرای مدلهای زبانی بزرگ (LLM) فعالیت میکنید، خبر جدید در مورد «OpenPangu» برایتان جذاب خواهد بود. محققان به تازگی بررسی دقیقی روی عملکرد این مدلها در سختافزارهای Ascend NPU انجام دادهاند.
نتایج کلیدی این تحقیق:
✅ کوانتایزیشن ۸ بیتی (Weight-only) تقریباً بدون افت دقت روی این تراشهها کار میکند.
✅ استفاده از کوانتایزیشن ۴ بیتی برای مدلهای ۷ میلیاردی کاملاً عملیاتی است، اما برای مدلهای کوچکتر (1B) میتواند باعث کاهش کیفیت در وظایف منطقی و ریاضی شود.
✅ همچنان چالشهای بزرگی در کوانتایزیشنهای فوقکمدقت (2-bit) وجود دارد که نیاز به تحقیقات بیشتری دارد.
این مطالعه راهنمای بسیار خوبی برای انتخاب بهترین تنظیمات جهت کاهش هزینههای استقرار مدلهای بومی روی سختافزارهای هواوی است. 💡
منبع: arXiv AI
