محققان در پژوهشی جالب، جنبهای متفاوت از ضعف مدلهای بینایی-زبانی (Vision Language Models) را بررسی کردهاند. این مدلها که قرار است دنیا را مانند ما درک کنند، گاهی دچار «خطای دید معکوس» میشوند!
ماجرا اینجاست که این مدلها نه تنها در تشخیص خطاهای دید کلاسیک (مثل تصاویر گنگ) دچار مشکل میشوند، بلکه گاهی اوقات حتی در تصاویری که کاملاً شفاف و معمولی هستند هم به اشتباه «خطای دید» میبینند. در واقع، سیستمهای هوشمند در تشخیص واقعیت از توهم، هنوز مسیر درازی در پیش دارند.
این تحقیق به ما یادآوری میکند که هوش مصنوعی هنوز تا رسیدن به درک بصری دقیق انسانی فاصله دارد و باید روی نحوه پردازش اطلاعات محیطی این مدلها بیشتر کار شود.
منبع: arXiv NLP
