محققان در مقالهای جدید به چالش مهمی در ارزیابی هوش مصنوعی پرداختهاند: «معیارهای سنجش فعلی، خطاها را پنهان میکنند!»
نکته کلیدی اینجاست که دقت (Accuracy) همیشه نشاندهنده هوشمندی مدل نیست. گاهی مدلها به دلیل محدودیتهای خروجی یا مشکلات در ساختار پاسخدهی، شکست میخورند اما این شکستها در امتیاز نهایی گم میشود. محققان یک چارچوب دو لایه پیشنهاد دادهاند که «کیفیت اجرای دستور» را از «صحت پاسخ» جدا میکند تا ارزیابی واقعیتری از توانایی مدلهای بزرگ داشته باشیم.
این تحقیق اهمیتِ گزارش دقیقِ نحوه عملکرد مدل در مراحل قبل از رسیدن به پاسخ نهایی را یادآوری میکند تا فریبِ اعداد ساده را نخوریم!
منبع: arXiv NLP
