مدلهای زبانی چندوجهی (MLLM) امروزه در تحلیل تصاویر پیشرفت زیادی داشتهاند، اما یک چالش بزرگ همچنان باقی است: وقتی آنچه مدل در تصویر میبیند با دانش قبلیاش (Pretrained knowledge) در تضاد است، کدام را انتخاب میکند؟
محققان در مطالعه اخیر خود با معرفی بنچمارک جدید «WhatIfVis»، این موضوع را بررسی کردهاند. یافتهها نشان میدهد:
✅ مشکل اصلی در «ندیدن» تصویر نیست، بلکه در نحوه پردازش و استفاده از اطلاعات بصری بعد از درک اولیه است.
✅ مدلهای معمولی اغلب در مدیریت این تضاد سردرگم هستند.
✅ آموزشهای اختصاصی (SFT) میتواند توانایی مدل را برای اتکای بیشتر به واقعیت موجود در تصویر و کنترل دقیقتر، به میزان چشمگیری افزایش دهد.
این تحقیق گامی مهم برای درک بهترِ نحوه استدلال بصری در هوش مصنوعی و رفع خطاهای ادراکی آنهاست. 🤖✨
منبع: arXiv Computer Vision
