آیا مدلهای هوش مصنوعی واقعاً میفهمند دوربین در یک ویدیو چگونه حرکت میکند؟ محققان در مطالعه اخیر خود نشان دادهاند که اکثر مدلهای چندوجهی (VLM) در تشخیص مفاهیمی مثل «چرخش» در مقابل «ترجمه» (حرکت خطی) یا تفاوت بین حرکت اشیاء و حرکت دوربین دچار اشتباه میشوند! 🤖
برای حل این مشکل، پژوهشگران ضمن ارائه یک طبقهبندی سینمایی جدید، بنچمارک گستردهای را برای ارزیابی دقیق حرکات دوربین طراحی کردهاند. آنها همچنین مدلی با نام VLM-8B را معرفی کردهاند که در این زمینه توانسته عملکرد بسیار بهتری نسبت به رقبا داشته باشد.
این پیشرفت نه تنها به درک بهتر ویدیوها کمک میکند، بلکه زیربنای مهمی برای نسل آینده مدلهای تولید ویدیو (Video Generation) خواهد بود. 🚀
منبع: arXiv Computer Vision
