محققان در جدیدترین پژوهش خود، مدل پایه LingBot-VA 2.0 را معرفی کردهاند که گامی بزرگ در حوزه کنترل رباتیک محسوب میشود. برخلاف مدلهای ویدیویی که صرفاً برای تولید محتوا هستند، این مدل «از پایه» برای تعامل با دنیای فیزیکی طراحی شده است.
ویژگیهای کلیدی این مدل:
🔹 توکنایزر بصری-عملیاتی: تطبیق دقیقتر بین دستورات و حرکات ربات.
🔹 آموزش علّی (Causal): جلوگیری از فراموشی اطلاعات در فرآیند یادگیری.
🔹 معماری MoE: افزایش ظرفیت مدل بدون کاهش سرعت در زمان اجرا.
🔹 کنترل حلقه-بسته آنی: اجرای حرکات دقیق با پیشبینی وضعیت آینده در لحظه.
این پیشرفت میتواند آینده رباتهای هوشمند را در انجام کارهای پیچیده و عمومی متحول کند. 🚀
منبع: arXiv Computer Vision
