📊 چرا مدل‌های بینایی-زبانی در درک اعداد و شمارش ویدئوها ضعیف هستند؟ معرفی VidNum!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

حتماً براتون پیش اومده که یک مدل هوش مصنوعی در تحلیل دقیق یک ویدئو، مخصوصاً وقتی پای شمارش یا محاسبات ریاضی وسط باشه، دچار سردرگمی بشه. محققان به تازگی بنچمارک جدیدی به نام «VidNum» رو معرفی کردند تا دقیقاً همین نقاط ضعف رو ریشه‌یابی کنند.

این بنچمارک با ۱۱۶۷ سوال تخصصی، مدل‌های VLM رو در سه سطح مختلف به چالش می‌کشه و نشون میده که مدل‌های فعلی حتی با استفاده از قابلیت «زنجیره تفکر» (CoT) هم در کارهای ساختاریافته و استدلالی مشکل دارند. در حالی که انسان‌ها در این تست‌ها به دقت بالای ۹۸٪ می‌رسند، بهترین مدل‌های هوش مصنوعی فعلاً از ۵۹.۸٪ فراتر نرفتند!

این یعنی هنوز راه زیادی تا درک کاملِ «کمیت» در ویدئوها توسط هوش مصنوعی باقی مونده. 🤖📈

منبع: arXiv Computer Vision