تا به حال فکر کردهاید که مدلهای هوش مصنوعی چقدر در مکالمات طولانی و چندمرحلهای واقعاً «خوشصحبت» هستند؟ بنچمارک جدیدی به نام EYT-Bench با یک روش سهلایه (شبیهساز کاربر، مدل هدف و قاضی هوشمند) طراحی شده تا فراتر از آزمونهای ساده عمل کند.
این تحقیق نشان میدهد که بسیاری از مدلهای قدرتمند، در عین شباهت در امتیازات کیفی، در دقتِ درکِ قصدِ کاربر (Intent Tracking) تفاوتهای فاحشی دارند و حتی پدیدهای به نام «اثر گرمشدن» (Warm-up Effect) را در اکثر آنها مشاهده کردهاند! این ابزار جدید کمک میکند تا بفهمیم کدام مدلها در نگهداریِ شخصیت (Persona) و هدفگذاری در گفتگوهای طولانی واقعاً برتر هستند.
منبع: arXiv NLP
