🔍 چرا هوش مصنوعی گاهی بین «دیدن» و «دانستن» دچار تضاد می‌شود؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های زبانی چندوجهی (MLLM) امروزه در تحلیل تصاویر پیشرفت زیادی داشته‌اند، اما یک چالش بزرگ همچنان باقی است: وقتی آنچه مدل در تصویر می‌بیند با دانش قبلی‌اش (Pretrained knowledge) در تضاد است، کدام را انتخاب می‌کند؟

محققان در مطالعه اخیر خود با معرفی بنچ‌مارک جدید «WhatIfVis»، این موضوع را بررسی کرده‌اند. یافته‌ها نشان می‌دهد:

✅ مشکل اصلی در «ندیدن» تصویر نیست، بلکه در نحوه پردازش و استفاده از اطلاعات بصری بعد از درک اولیه است.
✅ مدل‌های معمولی اغلب در مدیریت این تضاد سردرگم هستند.
✅ آموزش‌های اختصاصی (SFT) می‌تواند توانایی مدل را برای اتکای بیشتر به واقعیت موجود در تصویر و کنترل دقیق‌تر، به میزان چشمگیری افزایش دهد.

این تحقیق گامی مهم برای درک بهترِ نحوه استدلال بصری در هوش مصنوعی و رفع خطاهای ادراکی آن‌هاست. 🤖✨

منبع: arXiv Computer Vision