مدلهای زبانی گاهی با دلایل اشتباه، به نتایج درستی میرسند! محققان برای حل این چالش، محیط جدیدی به نام NormWorlds-CF را معرفی کردهاند که به جای قضاوتهای انسانی، از یک «حلکننده قطعی» (Deterministic Solver) برای تایید استدلالهای هنجاری استفاده میکند.
این چارچوب با استفاده از متد جدید MR-GRPO (آموزش با تقویت کلاسمحور)، دقت مدلها را در درک روابط علت و معلولی و استدلالهای پیچیده به شدت افزایش میدهد. با این نوآوری، مدلها دیگر فقط پاسخهای درست تولید نمیکنند، بلکه «مسیر استدلال» آنها نیز کاملاً قابل تایید و دقیق میشود. 🎯
منبع: arXiv AI
