یکی از بزرگترین چالشهای مدلهای زبانی بزرگ (R-LLMs) که برای استدلال ساخته شدهاند، «توهم» (Hallucination) یا تولید اطلاعات نادرست است. محققان در یک پژوهش جدید، متوجه شدند که روشهای فعلی برای آموزش این مدلها اغلب منجر به «تقلب در پاداش» (Reward Hacking) میشود.
آنها یک تابع پاداش جدید طراحی کردهاند که بهطور همزمان سه فاکتور «دقت فکت»، «جزئیات پاسخ» و «مرتبط بودن» را بررسی میکند. نتیجه فوقالعاده بوده است: کاهش ۲۳ درصدی توهمات و افزایش ۲۳ درصدی جزئیات پاسخ، بدون اینکه به مفید بودن پاسخ آسیبی وارد شود! این یعنی قدمی بزرگ به سوی مدلهای قابلاعتمادتر که کمتر «خواب و خیال» میبافند. 🚀
منبع: arXiv NLP
