📊 چرا به رتبه‌بندی‌های فعلی هوش مصنوعی نمی‌توان اعتماد کرد؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا تا به حال به نمرات بنچمارک مدل‌های زبانی نگاه کرده‌اید؟ محققان در مقاله‌ای جدید نشان داده‌اند که روش‌های فعلی امتیازدهی، دچار مشکلی به نام «تورم اعتماد» هستند.

مشکل اینجاست که میانگین گرفتن از نمرات، باعث می‌شود ضعف‌های مدل در تست‌های خاص پنهان بماند. نویسندگان این مقاله پیشنهاد می‌دهند که نتایج ارزیابی باید مانند یک «ادعای علمی» با تاریخ انقضا و سطح اعتبار شفاف منتشر شوند، چون با گذشت زمان و آلوده شدن داده‌ها، این امتیازها به سرعت اعتبار خود را از دست می‌دهند.

به نظر شما، آیا وقت آن نرسیده که استانداردهای سنجش هوش مصنوعی متحول شود؟ 🧐

منبع: arXiv AI