مدلهای VLA (بینایی-زبان-عمل) در حال حاضر در درک محیط قوی هستند، اما برای تعامل واقعی با دنیای فیزیکی، نیاز به «درک هندسی» دارند. مدل جدید Lift3D-VLA دقیقاً برای حل همین مشکل طراحی شده است!
این مدل با استفاده از ابر نقاط سهبعدی (Point Clouds) و یک سیستم آموزشی نوآورانه به نام GC-MAE، به رباتها کمک میکند نه تنها فضای اطراف خود را بهتر ببینند، بلکه تغییرات و حرکتهای محیطی را نیز پیشبینی کنند. این یعنی رباتهایی که در محیطهای پویا و متغیر، با دقت و هوشمندی بسیار بیشتری عمل میکنند.
این دستاورد گامی بزرگ در هوشمندسازی بازوهای رباتیک و سیستمهای خودکار صنعتی است که مرز بین هوش مصنوعی و دنیای فیزیکی را کمرنگتر میکند. 🦾✨
منبع: arXiv Computer Vision
