مدلهای زبانی چندوجهی (MLLM) در درک کلی تصاویر خوب عمل میکنند، اما وقتی پای «جستوجوی عمیق تصویری» (Visual DeepSearch) وسط میآید که نیاز به بررسی چندمرحلهای و جستوجوی دقیق در جزئیات دارد، هنوز راه درازی در پیش دارند.
به تازگی بنچمارک جدیدی به نام VistaHop معرفی شده که توانایی مدلهای هوش مصنوعی را در «جستوجوی چندمرحلهای» و پیدا کردن شواهد دقیق در تصاویر آزمایش میکند. نتایج نگرانکننده است: حتی مدلهای پیشرفتهای مثل SenseNova-MARS-32B هم نتوانستهاند نمره قبولی بالایی در این تست بگیرند (تنها ۲۶ درصد موفقیت!). این یعنی هنوز برای رسیدن به ایجنتهای هوشمندی که بتوانند مثل انسان در تصاویر «جستوجو و استدلال» کنند، به نوآوریهای بیشتری نیاز داریم. 🧠✨
منبع: arXiv AI
