مدلهای زبانی بزرگ (LLM) همیشه نمیدانند چه زمانی برای پاسخ دادن به یک سوال، نیاز به جستجو در اینترنت دارند و چه زمانی دانش درونیشان کافی است. این موضوع باعث میشود گاهی با اطلاعات اضافه یا پاسخهای نادرست مواجه شویم.
محققان در یک پژوهش جدید، رویکرد هوشمندانهای به نام «Counterfactual Supervision» برای مدیریت «مسیریابی جستجو» معرفی کردهاند. آنها با مقایسه نتایجِ «جستجو کردن» در برابر «جستجو نکردن» برای پرسشهای مشابه، یک سیستم نظارتی ساختهاند که به مدل یاد میدهد چه زمانی بهتر است جستجو کند و چه زمانی سکوت یا اتکا به دانش درونیاش منطقیتر است.
این پیشرفت روی مدلهایی مثل Gemma و Qwen تست شده و دقت تصمیمگیری آنها را به شکل چشمگیری بهبود داده است. نتیجه نهایی؟ مدلهایی که هم کمتر وقت تلف میکنند و هم پاسخهای دقیقتری ارائه میدهند!
منبع: arXiv AI
