🔍 چطور گفتگوهای مدل‌های زبانی را دقیق‌تر ارزیابی کنیم؟ معرفی EYT-Bench 🤖

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا به حال فکر کرده‌اید که مدل‌های هوش مصنوعی چقدر در مکالمات طولانی و چندمرحله‌ای واقعاً «خوش‌صحبت» هستند؟ بنچمارک جدیدی به نام EYT-Bench با یک روش سه‌لایه (شبیه‌ساز کاربر، مدل هدف و قاضی هوشمند) طراحی شده تا فراتر از آزمون‌های ساده عمل کند.

این تحقیق نشان می‌دهد که بسیاری از مدل‌های قدرتمند، در عین شباهت در امتیازات کیفی، در دقتِ درکِ قصدِ کاربر (Intent Tracking) تفاوت‌های فاحشی دارند و حتی پدیده‌ای به نام «اثر گرم‌شدن» (Warm-up Effect) را در اکثر آن‌ها مشاهده کرده‌اند! این ابزار جدید کمک می‌کند تا بفهمیم کدام مدل‌ها در نگهداریِ شخصیت (Persona) و هدف‌گذاری در گفتگوهای طولانی واقعاً برتر هستند.

منبع: arXiv NLP