🚀 هوش مصنوعی در تست هوش ویدئویی؛ آیا مدل‌ها واقعاً «درک» می‌کنند؟ 🎥🧠

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به‌تازگی بنچمارک جدیدی به نام VidNum-1.4K معرفی کردند که توانایی مدل‌های زبانی-تصویری (VLM) را در «استدلال عددی» بر اساس ویدئو به چالش می‌کشد. برخلاف تست‌های ساده قبلی، این بنچمارک شامل بیش از ۱۳۰۰ ویدئوی پیچیده است که مدل‌ها باید در آن‌ها محاسبات ریاضی، مقایسه‌ها و منطق چندمرحله‌ای را به‌صورت دقیق انجام دهند.

نتایج این ارزیابی نشان می‌دهد حتی مدل‌های قدرتمندی مثل Gemini-3.1-pro هم هنوز با چالش‌های بزرگی در درک منطق عددی ویدئوها روبرو هستند. این یافته‌ها به ما نشان می‌دهد که راه زیادی تا رسیدن به هوش مصنوعی با «درک درونی» واقعی از دنیای پیرامون باقی مانده است! 🧐📉

منبع: arXiv Computer Vision