تا امروز مدلهای هوش مصنوعی بیناییمحور (VLA) درک خوبی از محیط داشتند، اما در تعاملات ظریف مثل «چنگ زدن» یا کار با اشیاء فیزیکی به دلیل نبود حس لامسه دچار مشکل بودند. حالا محققان روشی به نام TacFiLM معرفی کردهاند که به رباتها اجازه میدهد سیگنالهای لمسی (مثل میزان اصطکاک و فشار) را با دادههای تصویری ادغام کنند.
این یعنی رباتها در کارهای حساس مثل جابجایی اشیاء یا باز کردن کشوها، هوشمندتر و پایدارتر عمل میکنند. جذابیت اصلی این روش در سبک بودن آن است که اجازه میدهد بدون نیاز به آموزشهای سنگین، رباتها در دنیای واقعی عملکردی بسیار دقیقتر داشته باشند. 🦾✨
منبع: arXiv Computer Vision
