حتماً میدانید که فشردهسازی مدلهای بزرگ (Quantization) معمولاً باعث افت کیفیت آنها میشود، بهویژه وقتی سراغ مدلهای سبکتر مثل ۳ یا ۴ بیتی میرویم. حالا محققان تکنیک جدیدی به نام RDQ معرفی کردهاند که این مشکل را به شکل خیرهکنندهای حل کرده است!
💡 نکته کلیدی این روش چیست؟
این مدل با شناسایی «خطاهای توزیع» در لایههای مدل، از روشی به نام «جبران خطای آبشاری» (CEC) استفاده میکند تا نویزهای حاصل از کوانتیزاسیون را پیش از تبدیل به مدلهای کوچکتر خنثی کند.
نتایج؟ بینظیر! این روش روی مدلهای قدرتمندی مثل LLaMA-3، Qwen-2.5 و Mistral تست شده و توانسته رکورد دقت فعلی را برای مدلهای فشرده جابهجا کند. خبر خوب اینکه این بهبود عملکرد بدون هیچ فشار اضافهای در زمان اجرا (Inference) به دست میآید! ✅
این یعنی به زودی مدلهای کوچکتر، دقیقتر و سریعتر روی سختافزارهای معمولی در دسترس ما خواهند بود.
منبع: arXiv Machine Learning
