آیا رباتها میتوانند اشیاء را با دقت انسان ببینند و جابهجا کنند؟ محققان مدل جدیدی به نام PoseVLA معرفی کردهاند که مشکل رایج «عدم درک جزئیات سهبعدی» در مدلهای بینایی-زبانی-کنشی (VLA) را حل میکند.
این مدل با جدا کردن مرحله «درک فضایی سهبعدی» از «کنترل حرکتی»، توانسته در وظایف پیچیده رباتیک به نرخ موفقیت چشمگیری (تا ۹۶٪) دست پیدا کند. این یعنی رباتها حالا با آموزشهای کمتر، خیلی هوشمندتر و دقیقتر محیط اطرافشان را درک میکنند. یک گام بزرگ دیگر به سوی رباتهای همکارِ واقعی! 🦾✨
منبع: arXiv Computer Vision
