محققان بهتازگی بنچمارک جدیدی به نام VidNum-1.4K معرفی کردند که توانایی مدلهای زبانی-تصویری (VLM) را در «استدلال عددی» بر اساس ویدئو به چالش میکشد. برخلاف تستهای ساده قبلی، این بنچمارک شامل بیش از ۱۳۰۰ ویدئوی پیچیده است که مدلها باید در آنها محاسبات ریاضی، مقایسهها و منطق چندمرحلهای را بهصورت دقیق انجام دهند.
نتایج این ارزیابی نشان میدهد حتی مدلهای قدرتمندی مثل Gemini-3.1-pro هم هنوز با چالشهای بزرگی در درک منطق عددی ویدئوها روبرو هستند. این یافتهها به ما نشان میدهد که راه زیادی تا رسیدن به هوش مصنوعی با «درک درونی» واقعی از دنیای پیرامون باقی مانده است! 🧐📉
منبع: arXiv Computer Vision
