محققان در پژوهشی جدید، چارچوبی برای آموزش مدلهای زبانی-تصویری (VLM) معرفی کردهاند که به رباتها کمک میکند «درک دیدگاه» (Visual Perspective Taking) پیدا کنند. این یعنی رباتها دیگر فقط تصویر نمیبینند، بلکه میتوانند فواصل و موقعیت اشیاء را در دنیای واقعی بهتر درک کنند.
آنها با استفاده از محیط شبیهساز NVIDIA Omniverse، مجموعهدادهای خاص تولید کردهاند که پایه اصلی «هوش مصنوعی تجسمیافته» (Embodied AI) برای تعامل بهتر ربات با انسان است. این یعنی آیندهای که در آن رباتها در محیطهای انسانی با درک فضایی دقیقتر حرکت میکنند. 🚀
منبع: arXiv AI
