🚀 رقابت و همکاری؛ فرمول جدید برای آموزش هوش مصنوعی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

دانشمندان در یک تحقیق جدید متوجه شدند که روش سنتی «تقلید» (SFT) برای آموزش مدل‌های کوچک‌تر در کدنویسی همیشه جواب نمی‌دهد و گاهی حتی باعث افت کیفیت آن‌ها می‌شود.

به جای آن، محققان چارچوبی طراحی کردند که در آن مدل‌های بزرگ و پیشرو (مثل Claude، Gemini و Grok) ابتدا در حل مسائل سخت با هم رقابت می‌کنند و سپس برای آموزش مدل‌های کوچک‌تر (مثل Qwen) با هم همکاری می‌کنند. نتیجه؟ استفاده از این «برنامه آموزشی تایید شده» با متد تقویت یادگیری (RLVR)، عملکرد مدل‌های دانش‌آموز را تا ۴۹٪ بهبود بخشیده است! 🎓✨

به نظر می‌رسد آینده آموزشِ مدل‌های هوش مصنوعی، در همکاریِ هوشمندانه بین مدل‌های بزرگ و تایید خروجی‌ها با تست‌های واقعی است، نه صرفاً کپی‌برداری از پاسخ‌ها.

‌نویسی

منبع: arXiv AI