مدلهای هوش مصنوعی معمولاً وقتی با مسائل ریاضی خیلی سخت روبرو میشوند، به دلیل نبود سیگنال پاداش، در حل آنها شکست میخورند. حالا محققان روشی به نام «Off-Context GRPO» ابداع کردهاند که به مدل اجازه میدهد با استفاده از «اطلاعات ممتاز» (Privileged Information) در حین آموزش، یاد بگیرد چطور بهتر استدلال کند.
این روش با اصلاح الگوریتم GRPO، به مدل کمک میکند بدون تغییر در خروجی نهایی، در مسائل پیچیده ریاضی ۱۳.۸ درصد عملکرد بهتری داشته باشد. گامی کوچک اما موثر برای هوشمندتر کردن استدلالهای مدلهای زبانی! 🧠✨
منبع: arXiv AI
