🤖 تعامل هوشمند انسان و ربات با قدرت مدل‌های زبانی! 🦾

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی سیستم جدیدی برای تعامل «ابر-لبه» (Cloud-Edge) طراحی کرده‌اند که به ربات‌ها اجازه می‌دهد محیط‌های پیچیده را بهتر درک کنند. این سیستم با ترکیب یک مدل تشخیص حرکت (YOLO) بهینه شده و قدرت تحلیل مدل‌های زبانی (LLM) و بینایی-زبانی (VLM)، دقت خیره‌کننده‌ای در شناسایی حرکات بدن حتی در شرایط سخت پیدا کرده است.

این یعنی ربات‌های آینده در درک فرامین ما و انجام وظایف پیچیده، بسیار دقیق‌تر و قابل‌اعتمادتر خواهند بود. تست‌های عملی روی ربات TonyPi نشان داده که این مدل در اجرای دستورات بصری و ترکیبی، عملکرد فوق‌العاده‌ای داشته است. گامی دیگر به سوی ربات‌های دستیار هوشمندتر! ✨

منبع: arXiv AI