🚀 نگاه هوش مصنوعی به جهان سه بعدی: معرفی مدل Cambrian-P!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

دانشمندان با معرفی مدل جدید Cambrian-P، قدم بزرگی در درک بهتر ویدئوها توسط هوش مصنوعی برداشته‌اند. تا به حال، اکثر مدل‌های بینایی-زبانی (MLLMs) ویدئوها را مجموعه‌ای از تصاویر دوبعدی مجزا می‌دیدند، اما Cambrian-P با استفاده از «تکنیک پوزیشن دوربین»، درک عمیق‌تر و فضایی‌تری از ویدئوها پیدا کرده است. این مدل با در نظر گرفتن موقعیت دوربین به عنوان یک سیگنال اصلی، توانسته در تحلیل‌های فضایی و پاسخ به سوالات ویدئویی، نتایج خیره‌کننده‌ای کسب کند. این یعنی در آینده، ربات‌ها و سیستم‌های بینایی ماشین، جهانِ فیزیکی اطراف ما را بسیار دقیق‌تر و شبیه‌تر به انسان درک خواهند کرد! 🎥🤖

منبع: arXiv Computer Vision