آیا رباتها میتوانند مستقیماً با صدای ما محیط اطرافشان را درک کنند و اشیاء را بردارند؟ در روشهای فعلی، ابتدا صدا به متن تبدیل (ASR) و سپس پردازش میشود که هم زمانبر است و هم احتمال خطا دارد.
محققان در مقاله جدیدی، فریمورک «Speech2Grasp» را معرفی کردهاند که به رباتهای انساننما اجازه میدهد مدلهای بینایی-زبانی را مستقیماً با «صوت» تطبیق دهند. این یعنی ربات بدون نیاز به تبدیل متنی، دستورات را با تأخیر کمتر و دقت بالاتر اجرا میکند. یک گام مهم برای تعامل طبیعیتر انسان و ربات در دنیای واقعی! 🦾✨
منبع: arXiv Computer Vision
