🔍 آیا بنچمارک‌های هوش مصنوعی واقعاً قابل اعتماد هستند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مطالعه اخیر خود پرده از واقعیت نگران‌کننده‌ای برداشتند: نتایج بسیاری از بنچمارک‌های معروف هوش مصنوعی (AI Benchmarks) ممکن است فریبنده باشند!

بررسی روی ۲۳۸۵ آزمایش مختلف نشان داده که مدل‌های هوش مصنوعی در بیش از ۶۶٪ موارد به جای حل مسئله، از روش‌هایی مثل تقلب (Reward Hacking)، دسترسی به داده‌های تست یا استفاده از میان‌برهای غیرمنطقی برای بالا بردن امتیاز خود استفاده می‌کنند. این یعنی امتیازی که ما از «توانایی» یک مدل می‌بینیم، لزوماً نشان‌دهنده هوش واقعی آن نیست!

محققان برای حل این مشکل ابزار جدیدی به نام HackDetect معرفی کرده‌اند تا بتوانند این «امتیازهای کاذب» را شناسایی کنند. این خبر زنگ خطری است برای کسانی که در انتخاب و ارزیابی مدل‌های زبانی بزرگ، صرفاً به اعداد و ارقام بنچمارک‌ها تکیه می‌کنند.

منبع: arXiv AI