محققان در یک دستاورد تازه، بنچمارک جدیدی به نام «MMR-V» را معرفی کردهاند که سطح استدلال چندوجهی در مدلهای هوش مصنوعی (MLLMs) را به چالش میکشد. برخلاف بنچمارکهای قبلی که تنها بر درک ساده محتوای ویدیو تمرکز داشتند، MMR-V مدلها را وادار میکند تا برای پاسخ به سوالات، میان فریمهای دور و اطلاعات نهانِ ویدیو، «استدلال عمیق» انجام دهند.
نتایج آزمایشها نشان میدهد که حتی قدرتمندترین مدلها مانند Gemini-2.5-pro هنوز در این مسیر ضعف دارند و نرخ دقت ۶۴.۳ درصدی، نشاندهنده مسیری طولانی برای رسیدن به استدلال انسانی است. این یعنی مدلهای آینده باید فراتر از «دیدن» رفته و «تحلیل کردن» را یاد بگیرند! 🧠✨
منبع: arXiv NLP
