محققان در پژوهشی جدید، چالش بزرگی را در ارزیابی مدلهای «واقعیتسنجی چندوجهی» (MAFC) مطرح کردهاند. مشکل اصلی اینجاست که بسیاری از بنچمارکهای فعلی دچار «آلودگی داده» (Contamination) هستند؛ یعنی مدلها پاسخها را نه از طریق تحلیل واقعی، بلکه به لطف دانش قبلی خود که در زمان آموزش دیدهاند، حفظ کردهاند! 🧠❌
این مطالعه نشان میدهد که حتی روشهای «ارزیابی پویا» هم که برای جلوگیری از این مشکل ابداع شدهاند، تا ۳۰ درصد همچنان آلوده هستند و میتوانند دقت مدلها را به صورت کاذب تا ۱۱ واحد افزایش دهند. این یافتهها زنگ خطری برای محققان است تا استانداردهای ارزیابی مدلهای زبانی را دقیقتر کنند.
منبع: arXiv NLP



