🔍 آیا دقت مدل‌های زبانی (LLM) فریب‌دهنده است؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای جدید به چالش مهمی در ارزیابی هوش مصنوعی پرداخته‌اند: «معیارهای سنجش فعلی، خطاها را پنهان می‌کنند!»

نکته کلیدی اینجاست که دقت (Accuracy) همیشه نشان‌دهنده هوشمندی مدل نیست. گاهی مدل‌ها به دلیل محدودیت‌های خروجی یا مشکلات در ساختار پاسخ‌دهی، شکست می‌خورند اما این شکست‌ها در امتیاز نهایی گم می‌شود. محققان یک چارچوب دو لایه پیشنهاد داده‌اند که «کیفیت اجرای دستور» را از «صحت پاسخ» جدا می‌کند تا ارزیابی واقعی‌تری از توانایی مدل‌های بزرگ داشته باشیم.

این تحقیق اهمیتِ گزارش دقیقِ نحوه عملکرد مدل در مراحل قبل از رسیدن به پاسخ نهایی را یادآوری می‌کند تا فریبِ اعداد ساده را نخوریم!

منبع: arXiv NLP