محققان در مطالعه جدید خود مدلی به نام MoSAIC را معرفی کردهاند که دنیای انیمیشن و تولید حرکات سهبعدی را متحول میکند. این مدل یک «چارچوب انتشار نهفته» (Latent Diffusion) است که اجازه میدهد حرکات بدن را به صورت بخشبهبخش (Part-local) از ویدیوهای مرجع استخراج کرده و به کاراکترهای دیگر منتقل کنید.
ویژگی کلیدی این مدل، قابلیت «نظارت مداخلهای همتراز» (Aligned Intervention Supervision) است که باعث میشود مدل هنگام انتقال حرکت، فقط بخشهای انتخابی (مثلاً دست یا پا) را تغییر دهد و سایر بخشهای بدن یا مسیر حرکت را دستنخورده باقی بگذارد. این یعنی دقت بسیار بالاتر در تولید انیمیشنهای طبیعی و کاهش خطاهای آزاردهنده در خروجیهای هوش مصنوعی. 🤖✨
منبع: arXiv Computer Vision
