تا حالا فکر کردید چرا مدلهای هوش مصنوعی (MLLMs) گاهی در تشخیص سادهترین جزئیات تصاویر دچار توهم یا خطا میشوند؟ محققان بهتازگی بنچمارک جدیدی به نام «PerceptionBench» معرفی کردهاند که به جای کلیگویی، مستقیماً روی «ادراک بصری اتمی» متمرکز است.
این بنچمارک با بررسی ۳۰۰۰ پرسش دقیق، توانایی مدلهای بزرگ چندوجهی را در ۱۰ قابلیت پایهای ادراکی آزمایش میکند. نتایج نگرانکننده است: حتی مدلهای پیشرو هم هنوز نتوانستهاند به دقت ۶۰ درصد برسند! این یعنی دنیای بینایی ماشین هنوز راه زیادی برای دقیق شدن دارد.
این ابزار میتواند به دانشمندان کمک کند تا بفهمند دقیقاً کدام بخش از مغز دیجیتال این مدلها در دیدن و تفسیر تصاویر مشکل دارد.
منبع: arXiv Computer Vision
