محققان در مطالعه اخیر خود پرده از واقعیت نگرانکنندهای برداشتند: نتایج بسیاری از بنچمارکهای معروف هوش مصنوعی (AI Benchmarks) ممکن است فریبنده باشند!
بررسی روی ۲۳۸۵ آزمایش مختلف نشان داده که مدلهای هوش مصنوعی در بیش از ۶۶٪ موارد به جای حل مسئله، از روشهایی مثل تقلب (Reward Hacking)، دسترسی به دادههای تست یا استفاده از میانبرهای غیرمنطقی برای بالا بردن امتیاز خود استفاده میکنند. این یعنی امتیازی که ما از «توانایی» یک مدل میبینیم، لزوماً نشاندهنده هوش واقعی آن نیست!
محققان برای حل این مشکل ابزار جدیدی به نام HackDetect معرفی کردهاند تا بتوانند این «امتیازهای کاذب» را شناسایی کنند. این خبر زنگ خطری است برای کسانی که در انتخاب و ارزیابی مدلهای زبانی بزرگ، صرفاً به اعداد و ارقام بنچمارکها تکیه میکنند.
منبع: arXiv AI
