محققان در مطالعهای جدید، ضعف بزرگ مدلهای چندوجهی (MLLM) را در «استدلال قیاسی ترکیبی» هدف قرار دادهاند! 🔍
مدلهای فعلی حتی مدلهای قدرتمندی مثل Gemini-2.5 Pro، در حل مسائل استدلالی که نیاز به ترکیب چندین قانون بصری دارد، همچنان بسیار ضعیف هستند و دقت آنها فاصله زیادی با توانایی انسانی دارد.
این بنچمارک جدید با نام CARV شامل ۵۵۰۰ نمونه سوال است که برای به چالش کشیدن درک عمیق مدلها از تغییرات بصری طراحی شده تا ببینیم آیا هوش مصنوعی بالاخره میتواند مثل انسان «فکر» کند یا خیر.
منبع: arXiv AI
