🔍 چرا مدل‌های بینایی-زبانی (VLM) در تشخیص نقص‌ها دچار اشتباه می‌شوند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی جدید، بنچمارک «MissingBench-Verified» را معرفی کرده‌اند که ضعف جدی مدل‌های هوش مصنوعی در تشخیص «اجزای گمشده» از اشیاء را فاش می‌کند. 🧐

نکته جالب اینجاست که حتی با ابزارهای کمکی، ویرایش تصویر و روش‌های پیشرفته استدلال، این مدل‌ها همچنان در تشخیص بخش‌های حذف‌شده شکست می‌خورند؛ چرا که دانش قبلی آن‌ها بر مشاهدات عینی غلبه می‌کند! این یافته نشان می‌دهد برای رسیدن به سیستم‌های نظارتی دقیق، نیازمند تغییرات بنیادی در ساختار مدل‌ها هستیم، نه فقط تغییر در دستورات (Prompting).

این یک چالش بزرگ برای آینده رباتیک و نظارت هوشمند است! 🤖💡

منبع: arXiv Computer Vision