🔍 آیا هوش مصنوعی در واقعیت‌سنجی فریب می‌خورد؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی جدید، چالش بزرگی را در ارزیابی مدل‌های «واقعیت‌سنجی چندوجهی» (MAFC) مطرح کرده‌اند. مشکل اصلی اینجاست که بسیاری از بنچمارک‌های فعلی دچار «آلودگی داده» (Contamination) هستند؛ یعنی مدل‌ها پاسخ‌ها را نه از طریق تحلیل واقعی، بلکه به لطف دانش قبلی خود که در زمان آموزش دیده‌اند، حفظ کرده‌اند! 🧠❌

این مطالعه نشان می‌دهد که حتی روش‌های «ارزیابی پویا» هم که برای جلوگیری از این مشکل ابداع شده‌اند، تا ۳۰ درصد همچنان آلوده هستند و می‌توانند دقت مدل‌ها را به صورت کاذب تا ۱۱ واحد افزایش دهند. این یافته‌ها زنگ خطری برای محققان است تا استانداردهای ارزیابی مدل‌های زبانی را دقیق‌تر کنند.

منبع: arXiv NLP