همونطور که ایجنتهای هوش مصنوعی دارن به سمت سیستمهای مکالمهمحور حرکت میکنن، ارزیابی دقیق اونها هم به یک چالش بزرگ تبدیل شده. خیلی از روشهای فعلی مثل «LLM-as-a-judge» سوگیری دارن و دقیق نیستن.
محققان به تازگی بنچمارک جدیدی به اسم τ-Rec رو معرفی کردن که بهجای قضاوتهای ذهنی، از پاداشهای قابلسنجش و مکانیزمهای کنترلی استفاده میکنه تا بفهمه ایجنت چقدر در استدلالهای خودش برای ارائه پیشنهادها دقیق و منطقی عمل میکنه.
نتایج آزمایشها روی مدلهای قدرتمندی مثل GPT-5.4 و Claude Sonnet 4.6 اصلاً درخشان نیست و نشون میده که حتی بهترین مدلها هم با یک «شکاف عملکردی» جدی روبرو هستن. این یعنی هنوز تا رسیدن به ایجنتهای کاملاً قابل اعتماد در سیستمهای توصیهگر راه زیادی داریم! 🤖⚖️
🔗 لینک گیتهاب پروژه: https://github.com/nbharaths/tau-rec
منبع: arXiv NLP
