آیا مدلهای زبانی فقط «جواب درست» را میدهند یا واقعاً میفهمند چه اتفاقی در حال رخ دادن است؟ محققان در مطالعه جدید خود دریافتهاند که مدلها اغلب به دلایل اشتباه به پاسخ درست میرسند.
آنها با معرفی محیط جدیدی به نام NormWorlds-CF و روش آموزشی مبتنی بر Metamorphic-Relation GRPO، راهکار جدیدی برای «استدلال هنجاری» (Normative Reasoning) ارائه کردهاند. این سیستم به جای تکیه بر قضاوتهای انسانی یا LLMها، از یک «حلکننده قطعی» برای اثبات و راستیآزمایی مراحل استدلال استفاده میکند.
نتیجه این پژوهش، آموزش مدلهایی است که به جای حدس زدن، منطق پشتِ پاسخهایشان را به خوبی درک میکنند و در مواجهه با شرایط تغییریافته، عملکرد بسیار دقیقتری دارند. گامی مهم برای افزایش اعتمادپذیری در مدلهای هوش مصنوعی!
منبع: arXiv AI
