محققان در مطالعه جدیدی به بررسی اهمیت «گرینولار یا دانهبندی پاداش» در آموزش مدلهای ریاضی (RLVR) پرداختند. نتایج نشان میدهد که در مدلهای زبانی کوچک، تمرکز بر اصلاح مرحلهبهمرحله (Process Reward) بهجای صرفاً نگاه به پاسخ نهایی، عملکرد آنها را تا ۱۰ درصد بهبود میدهد! 📈
این تحقیق ثابت میکند که برای مدلهای کوچک، دادن بازخورد در حین استدلال، بسیار مؤثرتر از پاداشهای کلی است و میتواند خطاهای استدلالی را بهشدت کاهش دهد. این یک گام بزرگ برای بهینهسازی مدلهای سبک و کارآمد در محاسبات پیچیده است.
منبع: arXiv Machine Learning
