🚀 یادگیری منطق در هوش مصنوعی: معرفی روش جدید OC-GRPO

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های هوش مصنوعی معمولاً وقتی با مسائل ریاضی خیلی سخت روبرو می‌شوند، به دلیل نبود سیگنال پاداش، در حل آن‌ها شکست می‌خورند. حالا محققان روشی به نام «Off-Context GRPO» ابداع کرده‌اند که به مدل اجازه می‌دهد با استفاده از «اطلاعات ممتاز» (Privileged Information) در حین آموزش، یاد بگیرد چطور بهتر استدلال کند.

این روش با اصلاح الگوریتم GRPO، به مدل کمک می‌کند بدون تغییر در خروجی نهایی، در مسائل پیچیده ریاضی ۱۳.۸ درصد عملکرد بهتری داشته باشد. گامی کوچک اما موثر برای هوشمندتر کردن استدلال‌های مدل‌های زبانی! 🧠✨

منبع: arXiv AI