محققان به تازگی بنچمارک جدیدی به نام OmniMapBench معرفی کردهاند که سطح متفاوتی از هوشمندی را در مدلهای زبانی-تصویری (LVLM) به چالش میکشد. برخلاف بسیاری از ابزارهای ارزیابی که مدلها میتوانند با تکیه بر متن به آنها پاسخ دهند، این بنچمارک بر «استدلال بصریِ غیرقابلتقلیل» تمرکز دارد.
✅ چرا این موضوع مهم است؟
بیش از ۲ هزار سوال در این مجموعه داده وجود دارد که مدلهای هوش مصنوعی را مجبور میکند واقعاً نقشه را «ببینند» و تحلیل کنند، نه اینکه فقط متنهای کنار آن را بخوانند. نتایج اولیه نشان میدهد حتی قویترین مدلهای حال حاضر هم در این آزمون با چالشهای جدی روبرو هستند و دقت متوسطی دارند.
این یک گام بزرگ برای رسیدن به هوش مصنوعیِ بصریِ واقعیتر است! اگر دوست دارید جزئیات فنی یا کدهای این پروژه را بررسی کنید، به گیتهاب آنها سر بزنید.
منبع: arXiv AI
