🧠 آیا هوش مصنوعی درک درستی از قوانین فیزیک در ویدیوها دارد؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی جدید، بنچمارک دقیق و تازه‌ای به نام «Video-HOCA» را معرفی کرده‌اند که برای ارزیابی «استدلال فیزیکی» در مدل‌های زبانی چندوجهی (Video-LLMs) طراحی شده است. 🎥

نکته کلیدی این تحقیق این است که مدل‌های فعلی، در شناسایی اشیاء در ویدیو عملکرد خوبی دارند، اما در درک علت و معلول و تعاملات فیزیکی (مثل افتادن یا برخورد اجسام) همچنان ضعف‌های جدی دارند. این بنچمارک با استفاده از بیش از ۱۴۰۰ ویدیو، به ما کمک می‌کند بفهمیم هوش مصنوعی تا چه حد می‌تواند دنیای واقعی را «بفهمد» و نه فقط آن را «ببیند».

این پیشرفت گامی بزرگ برای رسیدن به مدل‌های ویدیویی هوشمندتر و قابل‌اطمینان‌تر است. 🚀

منبع: arXiv Computer Vision