🔍 VistaHop؛ محک جدید برای هوش مصنوعی در جست‌وجوهای پیچیده تصویری!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های زبانی چندوجهی (MLLM) در درک کلی تصاویر خوب عمل می‌کنند، اما وقتی پای «جست‌وجوی عمیق تصویری» (Visual DeepSearch) وسط می‌آید که نیاز به بررسی چندمرحله‌ای و جست‌وجوی دقیق در جزئیات دارد، هنوز راه درازی در پیش دارند.

به تازگی بنچمارک جدیدی به نام VistaHop معرفی شده که توانایی مدل‌های هوش مصنوعی را در «جست‌وجوی چندمرحله‌ای» و پیدا کردن شواهد دقیق در تصاویر آزمایش می‌کند. نتایج نگران‌کننده است: حتی مدل‌های پیشرفته‌ای مثل SenseNova-MARS-32B هم نتوانسته‌اند نمره قبولی بالایی در این تست بگیرند (تنها ۲۶ درصد موفقیت!). این یعنی هنوز برای رسیدن به ایجنت‌های هوشمندی که بتوانند مثل انسان در تصاویر «جست‌وجو و استدلال» کنند، به نوآوری‌های بیشتری نیاز داریم. 🧠✨

منبع: arXiv AI