مدلهای بینایی-زبانی (VLM) که ترکیب تصویر و متن را تحلیل میکنند، گاهی با وجود کیفیت بالای تصویر، دچار خطاهای عجیبی میشوند. محققان به تازگی متوجه شدهاند که این خطاها دو دلیل اصلی دارند: یا مدل در «تشخیص» تصویر مشکل دارد، یا در «دانش و استدلال» درباره آن.
💡 نکته کلیدی پژوهش جدید این است که توانستهاند پیش از آنکه مدل پاسخ نهایی را تولید کند، نوعِ خطا را پیشبینی کنند! این یعنی سیستم میتواند پیش از ارائه پاسخ غلط، بفهمد مشکل از کجاست و آن را به ابزارهای کمکی (مثل بازیابی اطلاعات یا اصلاح تصویر) ارجاع دهد.
این پیشرفت، گام بزرگی برای کاهش توهمات و افزایش دقت هوش مصنوعی در درک دنیای پیرامون ماست. 🧠✨
منبع: arXiv Computer Vision
