آیا مدلهای هوش مصنوعی هم میتوانند مثل ما در حل مسائل سخت ریاضی به چالش بخورند؟ بله! روش رایج GRPO در مواجهه با مسائل بسیار پیچیده، گاهی کاملاً متوقف میشود چون مدل راه حلی پیدا نمیکند.
محققان در این پژوهش جدید، راهکار هوشمندانهای به نام AdaPrefix-GRPO ابداع کردهاند. این سیستم مثل یک معلم هوشمند عمل میکند که در ابتدا بخشی از مسیر حل مسئله را به مدل نشان میدهد (ارائه راهنمایی متغیر) و به تدریج با یادگیری مدل، این کمک را حذف میکند تا مدل به تنهایی به جواب برسد.
✅ نتایج خیرهکننده:
این روش دقت حل مسائل ریاضی در مدلهای کوچک را تا بیش از ۲ برابر افزایش داده و همچنین باعث بهینهتر شدن خروجیها شده است. گامی بزرگ برای هوشمندتر کردن مدلهای جمعوجور!
منبع: arXiv Machine Learning
