محققان به تازگی سیستم جدیدی برای تعامل «ابر-لبه» (Cloud-Edge) طراحی کردهاند که به رباتها اجازه میدهد محیطهای پیچیده را بهتر درک کنند. این سیستم با ترکیب یک مدل تشخیص حرکت (YOLO) بهینه شده و قدرت تحلیل مدلهای زبانی (LLM) و بینایی-زبانی (VLM)، دقت خیرهکنندهای در شناسایی حرکات بدن حتی در شرایط سخت پیدا کرده است.
این یعنی رباتهای آینده در درک فرامین ما و انجام وظایف پیچیده، بسیار دقیقتر و قابلاعتمادتر خواهند بود. تستهای عملی روی ربات TonyPi نشان داده که این مدل در اجرای دستورات بصری و ترکیبی، عملکرد فوقالعادهای داشته است. گامی دیگر به سوی رباتهای دستیار هوشمندتر! ✨
منبع: arXiv AI
