محققان در پژوهشی جدید، بنچمارک دقیق و تازهای به نام «Video-HOCA» را معرفی کردهاند که برای ارزیابی «استدلال فیزیکی» در مدلهای زبانی چندوجهی (Video-LLMs) طراحی شده است. 🎥
نکته کلیدی این تحقیق این است که مدلهای فعلی، در شناسایی اشیاء در ویدیو عملکرد خوبی دارند، اما در درک علت و معلول و تعاملات فیزیکی (مثل افتادن یا برخورد اجسام) همچنان ضعفهای جدی دارند. این بنچمارک با استفاده از بیش از ۱۴۰۰ ویدیو، به ما کمک میکند بفهمیم هوش مصنوعی تا چه حد میتواند دنیای واقعی را «بفهمد» و نه فقط آن را «ببیند».
این پیشرفت گامی بزرگ برای رسیدن به مدلهای ویدیویی هوشمندتر و قابلاطمینانتر است. 🚀
منبع: arXiv Computer Vision
