🧠 آیا هوش مصنوعی واقعاً می‌تواند استدلال کند؟ معرفی بنچمارک جدید CARV

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه‌ای جدید، ضعف بزرگ مدل‌های چندوجهی (MLLM) را در «استدلال قیاسی ترکیبی» هدف قرار داده‌اند! 🔍

مدل‌های فعلی حتی مدل‌های قدرتمندی مثل Gemini-2.5 Pro، در حل مسائل استدلالی که نیاز به ترکیب چندین قانون بصری دارد، همچنان بسیار ضعیف هستند و دقت آن‌ها فاصله زیادی با توانایی انسانی دارد.

این بنچمارک جدید با نام CARV شامل ۵۵۰۰ نمونه سوال است که برای به چالش کشیدن درک عمیق مدل‌ها از تغییرات بصری طراحی شده تا ببینیم آیا هوش مصنوعی بالاخره می‌تواند مثل انسان «فکر» کند یا خیر.

منبع: arXiv AI