🧠 آیا «نظارت بر فرآیند» کلید هوشمندتر شدن مدل‌های زبانی کوچک است؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه جدیدی به بررسی اهمیت «گرینولار یا دانه‌بندی پاداش» در آموزش مدل‌های ریاضی (RLVR) پرداختند. نتایج نشان می‌دهد که در مدل‌های زبانی کوچک، تمرکز بر اصلاح مرحله‌به‌مرحله (Process Reward) به‌جای صرفاً نگاه به پاسخ نهایی، عملکرد آن‌ها را تا ۱۰ درصد بهبود می‌دهد! 📈

این تحقیق ثابت می‌کند که برای مدل‌های کوچک، دادن بازخورد در حین استدلال، بسیار مؤثرتر از پاداش‌های کلی است و می‌تواند خطاهای استدلالی را به‌شدت کاهش دهد. این یک گام بزرگ برای بهینه‌سازی مدل‌های سبک و کارآمد در محاسبات پیچیده است.

منبع: arXiv Machine Learning