آیا تا به حال به نمرات بنچمارک مدلهای زبانی نگاه کردهاید؟ محققان در مقالهای جدید نشان دادهاند که روشهای فعلی امتیازدهی، دچار مشکلی به نام «تورم اعتماد» هستند.
مشکل اینجاست که میانگین گرفتن از نمرات، باعث میشود ضعفهای مدل در تستهای خاص پنهان بماند. نویسندگان این مقاله پیشنهاد میدهند که نتایج ارزیابی باید مانند یک «ادعای علمی» با تاریخ انقضا و سطح اعتبار شفاف منتشر شوند، چون با گذشت زمان و آلوده شدن دادهها، این امتیازها به سرعت اعتبار خود را از دست میدهند.
به نظر شما، آیا وقت آن نرسیده که استانداردهای سنجش هوش مصنوعی متحول شود؟ 🧐
منبع: arXiv AI
