آیا تا به حال به این فکر کردهاید که چطور میتوان حرکات دو نفر را که با هم در تعامل هستند، به زبان ماشین ترجمه کرد؟ محققان بهتازگی مدل جدیدی به نام MIME (Multimodal Interactive Motion Encoder) معرفی کردهاند که دقیقاً همین کار را انجام میدهد.
این مدل که برای اولین بار بهطور اختصاصی روی تعاملات «دو نفره» تمرکز دارد، با درکِ ساختار مشترک حرکات و استفاده از یادگیری پیشرفته، دقتِ تبدیل متن به حرکت را تا ۱۲.۸ درصد بهبود بخشیده است. این دستاورد میتواند آیندهی انیمیشنسازی، واقعیت مجازی (VR) و حتی ساخت رباتهای انساننما را بهشدت تحت تأثیر قرار دهد. 🔥
منبع: arXiv Computer Vision
