اگر در دنیای سختافزارهای هوش مصنوعی فعالیت میکنید، احتمالاً با چالشهای اجرای مدلهای زبانی بزرگ (LLM) روی شتابدهندههای Ascend آشنا هستید. حالا محققان با معرفی HiFA4، روشی نوآورانه برای پیادهسازی FlashAttention با دقت ۴ بیت ارائه کردهاند که بدون نیاز به آموزش مجدد، سرعت و کارایی مدلها را به شدت افزایش میدهد.
این طراحی که به طور اختصاصی برای معماری HIF4 بهینهسازی شده، نه تنها باعث کاهش خطاهای کوانتایزیشن میشود، بلکه دقت مدلهایی مثل Qwen3 را نیز در بنچمارکهای استاندارد به شکل محسوسی بهبود میبخشد. این یعنی مدلهای قدرتمندتر روی سختافزارهای بهینهتر!
منبع: arXiv AI
