مدلهای زبانی بزرگ (LLM) معمولاً در انجام یک کار خاص عالی هستند، اما وقتی پای چندین وظیفه متفاوت وسط میآید، عملکردشان دچار نوسان میشود. حالا محققان الگوریتم جدید «Multi-Task GRPO» یا همان MT-GRPO را معرفی کردهاند که این مشکل را حل میکند!
ویژگیهای کلیدی این دستاورد:
✅ ایجاد تعادل در یادگیری بین وظایف مختلف
✅ بهبود چشمگیر دقت در ضعیفترین بخشهای مدل (بین ۱۶ تا ۲۸ درصد بهبود)
✅ افزایش ۵۰ درصدی سرعت رسیدن به عملکرد بهینه
این روش جدید باعث میشود مدلهای هوش مصنوعی در دنیای واقعی، قابلاعتمادتر و هوشمندتر از همیشه عمل کنند. گامی بلند به سوی مدلهای چندمنظوره که در هر شرایطی بهترین خروجی را میدهند. 🧠✨
منبع: arXiv Machine Learning
