حتماً براتون پیش اومده که یک مدل هوش مصنوعی در تحلیل دقیق یک ویدئو، مخصوصاً وقتی پای شمارش یا محاسبات ریاضی وسط باشه، دچار سردرگمی بشه. محققان به تازگی بنچمارک جدیدی به نام «VidNum» رو معرفی کردند تا دقیقاً همین نقاط ضعف رو ریشهیابی کنند.
این بنچمارک با ۱۱۶۷ سوال تخصصی، مدلهای VLM رو در سه سطح مختلف به چالش میکشه و نشون میده که مدلهای فعلی حتی با استفاده از قابلیت «زنجیره تفکر» (CoT) هم در کارهای ساختاریافته و استدلالی مشکل دارند. در حالی که انسانها در این تستها به دقت بالای ۹۸٪ میرسند، بهترین مدلهای هوش مصنوعی فعلاً از ۵۹.۸٪ فراتر نرفتند!
این یعنی هنوز راه زیادی تا درک کاملِ «کمیت» در ویدئوها توسط هوش مصنوعی باقی مونده. 🤖📈
منبع: arXiv Computer Vision
