🚀 چالش جدید در هوش مصنوعی: فراتر از درک ساده ویدیو! 🎥

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک دستاورد تازه، بنچمارک جدیدی به نام «MMR-V» را معرفی کرده‌اند که سطح استدلال چندوجهی در مدل‌های هوش مصنوعی (MLLMs) را به چالش می‌کشد. برخلاف بنچمارک‌های قبلی که تنها بر درک ساده محتوای ویدیو تمرکز داشتند، MMR-V مدل‌ها را وادار می‌کند تا برای پاسخ به سوالات، میان فریم‌های دور و اطلاعات نهانِ ویدیو، «استدلال عمیق» انجام دهند.

نتایج آزمایش‌ها نشان می‌دهد که حتی قدرتمندترین مدل‌ها مانند Gemini-2.5-pro هنوز در این مسیر ضعف دارند و نرخ دقت ۶۴.۳ درصدی، نشان‌دهنده مسیری طولانی برای رسیدن به استدلال انسانی است. این یعنی مدل‌های آینده باید فراتر از «دیدن» رفته و «تحلیل کردن» را یاد بگیرند! 🧠✨

منبع: arXiv NLP