اگر با مدلهای بزرگ زبانی (LLM) کار کرده باشید، میدانید که فشردهسازی آنها بدون افت کیفیت چقدر چالشبرانگیز است! اما محققان به تازگی از فریمورک نوآورانه NIRVANA رونمایی کردهاند که قواعد بازی را تغییر میدهد.
این روش جدید، به جای روشهای سنتیِ مبتنی بر کاهش دقت، از محاسبات مبتنی بر «هسته مماس عصبی» (NTK) برای شناسایی بخشهای مهم مدل استفاده میکند. نتیجه کار چیست؟
✅ حفظ عملکرد مدل در حالت zero-shot
✅ پایداری بسیار بالا در فرآیند fine-tuning
✅ کاهش چشمگیر حجم مدل با کمترین افت کیفیت
این فریمورک که روی مدلهای قدرتمندی مثل Llama3 و Qwen تست شده، میتواند راهکاری ایدهآل برای اجرای مدلهای عظیم در محیطهای با منابع محدود باشد.
منبع: arXiv Machine Learning
