محققان در مقالهای جدید، چارچوب نوآورانهای به نام «GTA-VLA» (مخفف Guide, Think, Act) را معرفی کردهاند که تحولی در عملکرد رباتهای مجهز به هوش مصنوعی ایجاد میکند.
مشکل اصلی مدلهای فعلی این است که در مواجهه با شرایط پیشبینینشده، گیج میشوند و نمیتوانند به راحتی از انسان بازخورد بگیرند. حالا با این مدل جدید، کاربران میتوانند با استفاده از علائم بصری (مثل تعیین نقاط هدف یا کادرهای راهنما)، به ربات کمک کنند تا در محیطهای پیچیده تصمیمات دقیقتری بگیرد و اگر اشتباهی کرد، به راحتی اصلاحش کند. این یعنی گامی بلند به سوی رباتهایی که هوشمندتر فکر میکنند و بهتر با دنیای واقعی تعامل دارند. 🦾✨
منبع: arXiv Computer Vision
