یکی از مشکلات بزرگ مدلهای زبانی که قدرت استدلال بالایی دارند (LRMs)، این است که گاهی در حین فکر کردن، به جای رسیدن به پاسخ درست، دچار «توهم» میشوند و پاسخهای غلط تولید میکنند.
محققان به تازگی چارچوب جدیدی به نام MARGO را معرفی کردهاند که با استفاده از یادگیری تقویتی، به مدل کمک میکند متوجه شود که آیا «فکر کردن» اضافهاش واقعاً به دقت پاسخ کمک میکند یا صرفاً باعث انحراف از حقیقت میشود. این روش در واقع یک فیلتر هوشمند است که جلوی خیالبافیهای بیدلیل مدل را میگیرد تا پاسخهای نهایی دقیقتر و مستندتر باقی بمانند. 🚀
منبع: arXiv Machine Learning
