تولید ویدیوهای دارای صدا که در آنها حرکات لب و اتفاقات بصری کاملاً با صوت هماهنگ باشند، همیشه یکی از چالشهای بزرگ هوش مصنوعی بوده است. حالا محققان با معرفی «OmniVAE»، راهکار جدیدی برای حل این مشکل ارائه کردهاند!
💡 نکته کلیدی این مدل، آموزش همزمان فضای نهفته (Latent Space) برای صدا و تصویر است. برخلاف روشهای قدیمی که هر کدام را جداگانه آموزش میدادند، OmniVAE با استفاده از یک هدف کنتراستیو (Contrastive)، ارتباط معنایی و زمانی دقیق بین صدا و تصویر را برقرار میکند.
نتیجه این کار؟ تولید محتوای چندرسانهای با کیفیتِ بسیار بالاتر و سینک (Sync) بسیار دقیقتر که راه را برای نسل بعدی ابزارهای تولید محتوای هوشمند باز میکند.
منبع: arXiv Computer Vision
