محققان بهتازگی چارچوب قدرتمند و چندمنظورهای به نام «OmniMotion-X» را معرفی کردهاند که دنیای تولید حرکات انسانی (Whole-Body Motion Generation) را دگرگون میکند.
این مدل که از معماری «ترنسفورمرهای انتشار» (Diffusion Transformers) بهره میبرد، میتواند کارهای پیچیدهای مثل تبدیل متن به حرکت، موسیقی به رقص، و گفتار به ژست را با دقتی خیرهکننده انجام دهد.
نکات کلیدی این دستاورد:
✅ پشتیبانی از سناریوهای حرکتی متنوع (پیشبینی حرکت، بازسازی و کنترل فضایی).
✅ استفاده از «OmniMoCap-X»؛ بزرگترین مجموعه داده چندوجهی حرکتی که تا امروز ساخته شده.
✅ بهرهگیری از هوش مصنوعی GPT-4o برای تولید کپشنهای دقیق جهت بهینهسازی آموزش مدل.
این ابزار نه تنها برای انیمیشنسازی، بلکه برای درک عمیقتر رباتها از حرکات بدن انسان یک جهش بزرگ محسوب میشود. 🚀
منبع: arXiv Computer Vision
