دانشمندان در یک تحقیق جدید متوجه شدند که روش سنتی «تقلید» (SFT) برای آموزش مدلهای کوچکتر در کدنویسی همیشه جواب نمیدهد و گاهی حتی باعث افت کیفیت آنها میشود.
به جای آن، محققان چارچوبی طراحی کردند که در آن مدلهای بزرگ و پیشرو (مثل Claude، Gemini و Grok) ابتدا در حل مسائل سخت با هم رقابت میکنند و سپس برای آموزش مدلهای کوچکتر (مثل Qwen) با هم همکاری میکنند. نتیجه؟ استفاده از این «برنامه آموزشی تایید شده» با متد تقویت یادگیری (RLVR)، عملکرد مدلهای دانشآموز را تا ۴۹٪ بهبود بخشیده است! 🎓✨
به نظر میرسد آینده آموزشِ مدلهای هوش مصنوعی، در همکاریِ هوشمندانه بین مدلهای بزرگ و تایید خروجیها با تستهای واقعی است، نه صرفاً کپیبرداری از پاسخها.
نویسی
منبع: arXiv AI
