تحقیقات جدید در مقاله «Visual Credit Audit» چالش بزرگی را برای مدلهای چندوجهی (Multimodal) مطرح کرده است! 🧠
محققان متوجه شدند که بسیاری از مدلهای پیشرفته در تستهای استدلال فضایی، پاسخهای درستی میدهند اما نه به این دلیل که تصویر را واقعاً تحلیل کردهاند، بلکه صرفاً با اتکا به متن یا حدسهای آماری!
این مطالعه نشان میدهد که بین ۱۲ تا ۲۶ درصد پاسخهای صحیح مدلها در بنچمارکهای فضایی، عملاً هیچ «اعتبار بصری» ندارند. ابزار جدیدی به نام VCA معرفی شده که کمک میکند بفهمیم هوش مصنوعی چقدر به شواهد تصویری وابسته است و چقدر صرفاً خوششانس بوده! 🖼️✨
این خبر برای توسعهدهندگانی که روی دقت سیستمهای بینایی ماشین کار میکنند بسیار کلیدی است.
منبع: arXiv AI
