محققان قدم بزرگی در درک ماشین از محیطهای سهبعدی برداشتند. تکنیک جدیدی به نام «Holo-Captioning» معرفی شده که برخلاف مدلهای قبلی، فقط به تصویر نگاه نمیکند، بلکه اجزای یک صحنه سهبعدی، روابط بین اشیاء و ویژگیهای دقیق آنها را به صورت متنی و ساختاریافته توصیف میکند.
مدل جدید HoloScribe که همراه این پژوهش ارائه شده، با استفاده از یک پایپلاین نوآورانه، در تستهای بنچمارک توانسته مدلهای فعلی بینایی ماشین را پشت سر بگذارد. این یعنی در آینده، رباتها و سیستمهای واقعیت افزوده خیلی بهتر از قبل محیط اطرافشان را درک و توصیف خواهند کرد. 🤖✨
منبع: arXiv Computer Vision
