دنیای هوش مصنوعی چندوجهی (Multimodal) هر روز هیجانانگیزتر میشود! محققان به تازگی مدل جدیدی به نام «UniVideo» را معرفی کردهاند که قرار است کار تولید، درک و ویرایش ویدیو را به طور یکپارچه انجام دهد.
چرا UniVideo خاص است؟
✅ طراحی دوگانه: این مدل از ترکیب یک مدل زبانی بزرگ (MLLM) برای درک دستورات و یک MMDiT برای تولید دقیق ویدیو استفاده میکند.
✅ همه در یک قاب: برخلاف مدلهای قبلی که محدود به تصاویر بودند، این مدل وظایف پیچیده تولید و ویرایش ویدیو را در یک سیستم واحد ترکیب کرده است.
✅ هوشمندی در ویرایش: UniVideo میتواند حتی بدون آموزش مستقیم روی ویدیوهای خاص، با استفاده از دانش ویرایش تصویر، کارهای سنگینی مثل تغییر سبک یا ویرایشهای مفهومی را با دقت خیرهکنندهای انجام دهد.
این یعنی در آیندهای نزدیک، ساخت و ادیت ویدیوهای حرفهای با دستورات متنی ساده، بسیار در دسترستر و باکیفیتتر خواهد شد.
منبع: arXiv Computer Vision
