دانشمندان با معرفی مدل جدید Cambrian-P، قدم بزرگی در درک بهتر ویدئوها توسط هوش مصنوعی برداشتهاند. تا به حال، اکثر مدلهای بینایی-زبانی (MLLMs) ویدئوها را مجموعهای از تصاویر دوبعدی مجزا میدیدند، اما Cambrian-P با استفاده از «تکنیک پوزیشن دوربین»، درک عمیقتر و فضاییتری از ویدئوها پیدا کرده است. این مدل با در نظر گرفتن موقعیت دوربین به عنوان یک سیگنال اصلی، توانسته در تحلیلهای فضایی و پاسخ به سوالات ویدئویی، نتایج خیرهکنندهای کسب کند. این یعنی در آینده، رباتها و سیستمهای بینایی ماشین، جهانِ فیزیکی اطراف ما را بسیار دقیقتر و شبیهتر به انسان درک خواهند کرد! 🎥🤖
منبع: arXiv Computer Vision
