همانطور که میدانید، یکی از چالشهای اصلی اجرای مدلهای زبانی بزرگ (LLM)، مصرف حافظه و سنگینی آنهاست. کوانتیزاسیون ۴ بیتی یکی از راهکارهای رایج است، اما معمولاً با افت دقت مدل همراه میشود.
محققان در مطالعه اخیر، متد جدیدی به نام MXSens را معرفی کردهاند که بدون نیاز به آموزش مجدد، مدل را فشرده میکند. این روش با تحلیل هوشمندانه حساسیت لایهها و ستونها در ساختار مدل، بیتریت متغیری (۴، ۶ یا ۸ بیتی) را اختصاص میدهد. نتیجه؟ عملکردی بسیار دقیقتر در مدلهای قدرتمندی مثل LLaMA-3 بدون کاهش سرعت! 🧠💻
این یعنی در آینده نزدیک میتوانیم مدلهای غولپیکر را روی سختافزارهای محدودتر با کیفیتی به مراتب بالاتر اجرا کنیم.
منبع: arXiv AI
