آیا میدانستید مدلهای زبانی بزرگ که در برنامهنویسی مهارت بالایی دارند (مثل مدلهای MoE)، بخش بزرگی از حجمشان را «کارشناسانی» تشکیل میدهند که در کدهای برنامهنویسی هیچ نقشی ندارند؟
در تحقیق جدیدی که روی مدلهای Qwen و Gemma انجام شده، محققان ثابت کردند میتوان با حذف ۵۰٪ از این متخصصها، بدون افت دقت در کدنویسی، حجم مدل را به شدت کاهش داد تا روی سیستمهای معمولی هم قابل اجرا باشند! این یعنی مسیر جدیدی برای سبکتر کردن مدلهای هوش مصنوعی بدون قربانی کردن تواناییهای تخصصی آنها. 🧠✨
نویسی
منبع: arXiv Machine Learning
