با وجود پیشرفتهای خیرهکننده مدلهای چندوجهی (MLLM)، این مدلها هنوز در درک «استدلالهای زمانی» و «مفاهیم فیزیکی» در صحنههای پویا ضعف دارند. برای رفع این چالش، بنچمارک جدیدی به نام ViSTR-Bench معرفی شده است.
این ابزار ارزیابی، مهارت مدلهای هوش مصنوعی را در ۴ بعد اصلی بررسی میکند:
🔹 درک حرکت (Motion Perception)
🔹 روابط فضایی (Spatial Relations)
🔹 پیشبینی نتایج (Outcome Prediction)
🔹 دینامیکهای فیزیکی (Physical Dynamics)
با استفاده از بیش از ۱۳۰۰ ویدیوی تعاملی، این تحقیق نشان میدهد که هوش مصنوعی برای درک واقعی دنیای فیزیکی، هنوز راه زیادی در پیش دارد. گام مهمی برای رسیدن به مدلهایی که دنیای اطرافشان را مثل انسان تحلیل میکنند! ⚡️
منبع: arXiv Computer Vision
