📍 سنجش قدرت استدلال بصری هوش مصنوعی با OmniMapBench 🗺️🤖

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به تازگی بنچمارک جدیدی به نام OmniMapBench معرفی کرده‌اند که سطح متفاوتی از هوشمندی را در مدل‌های زبانی-تصویری (LVLM) به چالش می‌کشد. برخلاف بسیاری از ابزارهای ارزیابی که مدل‌ها می‌توانند با تکیه بر متن به آن‌ها پاسخ دهند، این بنچمارک بر «استدلال بصریِ غیرقابل‌تقلیل» تمرکز دارد.

چرا این موضوع مهم است؟
بیش از ۲ هزار سوال در این مجموعه داده وجود دارد که مدل‌های هوش مصنوعی را مجبور می‌کند واقعاً نقشه را «ببینند» و تحلیل کنند، نه اینکه فقط متن‌های کنار آن را بخوانند. نتایج اولیه نشان می‌دهد حتی قوی‌ترین مدل‌های حال حاضر هم در این آزمون با چالش‌های جدی روبرو هستند و دقت متوسطی دارند.

این یک گام بزرگ برای رسیدن به هوش مصنوعیِ بصریِ واقعی‌تر است! اگر دوست دارید جزئیات فنی یا کدهای این پروژه را بررسی کنید، به گیت‌هاب آن‌ها سر بزنید.

منبع: arXiv AI