محققان در دستاورد جدیدی به سراغ بهبود مدلهای بینایی-زبانی-کنشی (VLA) رفتهاند که مسئول کنترل رباتها هستند. تا پیش از این، رباتها حس وضعیت بدنی (Proprioception) خود را خیلی دیر در فرآیند پردازش درک میکردند که باعث هدر رفتن منابع و کاهش دقت میشد.
در روش جدید یعنی ThinkProprio، وضعیت بدنی ربات به صورت توکنهای متنی وارد مدل میشود تا ربات قبل از پردازش سنگین تصاویر، بفهمد چه چیزی برای انجام وظیفه (مثلاً جابهجایی یک جسم) واقعاً مهم است. نتیجه؟
✅ کاهش چشمگیر تاخیر در پاسخدهی (Latency)
✅ افزایش دقت در کارهای رباتیک در محیطهای واقعی
✅ حذف اطلاعات اضافه و تمرکز روی دادههای کلیدی
این یعنی رباتها در آینده با مصرف انرژی کمتر، بسیار سریعتر و هوشمندتر به دنیای فیزیکی اطرافشان واکنش نشان خواهند داد. 🦾
منبع: arXiv Computer Vision
