اگر با چالشهای سنگین بودن مدلهای زبانی (LLM) و هزینههای بالای اجرای آنها دستوپنج نرم میکنید، این خبر برای شماست! محققان به تازگی از رویکرد جدیدی به نام SALR رونمایی کردهاند که ترکیبی هوشمندانه از تکنیکهای LoRA و «هرس کردن» (Pruning) است.
ویژگیهای کلیدی این دستاورد:
✅ کاهش ۵۰ درصدی پارامترها بدون افت عملکرد در بنچمارکهای MMLU و GSM8K
✅ کاهش ۲ برابری حجم مدل برای ذخیرهسازی بهینه
✅ افزایش ۱.۷ برابری سرعت استنتاج (Inference) با استفاده از تکنیکهای سختافزاری مدرن
این روش با فشردهسازی هوشمند وزنهای ثابت و بازیابی اطلاعات از دست رفته از طریق آداپتورهای کمرتبه (Low-Rank)، راه را برای اجرای مدلهای قدرتمند روی سیستمهای با منابع محدود هموارتر میکند.
منبع: arXiv AI
