محققان مدل جدیدی به نام «Wan-Dancer» معرفی کردهاند که یکی از بزرگترین چالشهای تولید ویدیو با هوش مصنوعی، یعنی «تداوم زمانی» را حل میکند.
تا پیش از این، اکثر مدلهای تولید ویدیو در بازههای کوتاه (زیر ۲۰ ثانیه) دچار مشکل میشدند، اما Wan-Dancer میتواند با استفاده از یک معماری سلسلهمراتبی، ویدیوهای رقص با کیفیت 720p و به مدت بیش از یک دقیقه تولید کند که کاملاً با ریتم موسیقی هماهنگ هستند! 🎶✨
نکته جالب این مدل، استفاده از کنترل دقیق بر روی حرکات و هماهنگی کامل بین متن، صوت و ویدیو است که کیفیت حرکات را حتی در صحنههای سریع هم حفظ میکند.
منبع: arXiv Computer Vision



