محققان در پژوهشی تازه، روشی خلاقانه و بهینه برای کنترل رباتها معرفی کردهاند. در مدلهای فعلی، برای پردازش تصاویر، یا جزئیات فدا میشوند و یا به دلیل استفاده از مدلهای غولآسا، سرعت بسیار پایین میآید.
مدل جدید Patch Policy این مشکل را حل کرده است:
✅ این معماری به رباتها اجازه میدهد مستقیماً از «تکههای بصری» (Patch Tokens) مدلهای بینایی استفاده کنند، بدون اینکه نیاز به پردازش سنگین مدلهای چندوجهی (VLM) داشته باشند.
✅ نتیجه؟ عملکردی ۴۰ درصد بهتر نسبت به روشهای سنتی و برتری ۱۸ درصدی نسبت به مدلهای پیشرفتهای مثل OpenVLA-OFT، آن هم تنها با کمتر از ۱ درصد از پارامترهای آنها! این یعنی یک قدم بزرگ به سوی رباتهای سریعتر و هوشمندتر. 🦾
منبع: arXiv Machine Learning
