محققان به تازگی مدل نوآورانهای به نام UniD معرفی کردهاند که میتواند به صورت یکپارچه، ۸ ویژگی کلیدی ویدیو از جمله عمق، بخشبندی معنایی، قطعات بدن انسان و بافتها را تنها از طریق دادههای مجزا و بدون نیاز به برچسبگذاری پیچیده، درک و پیشبینی کند!
این مدل با بهرهگیری از قدرت مدلهای نفوذی (Diffusion Models)، شکافهای بین دادههای مختلف را پر کرده و عملکردی در سطح متخصصین هر حوزه ارائه میدهد. این گام بزرگی برای سیستمهای درک صحنه در رباتیک و خودروهای خودران است.
اطلاعات بیشتر و دموها در لینک زیر قابل مشاهده است:
🔗 https://unid-video.github.io/
منبع: arXiv Computer Vision
