🔍 محک زدن دقیق «ادراک بصری» در مدل‌های چندوجهی با PerceptionBench

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا حالا فکر کردید چرا مدل‌های هوش مصنوعی (MLLMs) گاهی در تشخیص ساده‌ترین جزئیات تصاویر دچار توهم یا خطا می‌شوند؟ محققان به‌تازگی بنچمارک جدیدی به نام «PerceptionBench» معرفی کرده‌اند که به جای کلی‌گویی، مستقیماً روی «ادراک بصری اتمی» متمرکز است.

این بنچمارک با بررسی ۳۰۰۰ پرسش دقیق، توانایی مدل‌های بزرگ چندوجهی را در ۱۰ قابلیت پایه‌ای ادراکی آزمایش می‌کند. نتایج نگران‌کننده است: حتی مدل‌های پیشرو هم هنوز نتوانسته‌اند به دقت ۶۰ درصد برسند! این یعنی دنیای بینایی ماشین هنوز راه زیادی برای دقیق شدن دارد.

این ابزار می‌تواند به دانشمندان کمک کند تا بفهمند دقیقاً کدام بخش از مغز دیجیتال این مدل‌ها در دیدن و تفسیر تصاویر مشکل دارد.

منبع: arXiv Computer Vision