🎬 انقلابی در تولید همزمان ویدیو و صدا با OmniCustom

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

دنیای هوش مصنوعی مولد دوباره شگفت‌زده‌مان کرد! محققان به تازگی از چارچوب قدرتمند جدیدی به نام OmniCustom رونمایی کرده‌اند که یک گام فراتر از مدل‌های قبلی است.

این مدل جدید چی کار می‌کنه؟
به جای اینکه فقط تصویر یا ویدیو تولید کنه، می‌تونه «هویت تصویری» و «لحن صوتی» رو به صورت همزمان شخصی‌سازی کنه. یعنی شما یک عکس مرجع و یک فایل صوتی به مدل می‌دید و اون ویدیویی تولید می‌کنه که هم دقیقاً شبیه اون تصویره و هم با صدای اون فایل صوتی صحبت می‌کنه؛ اون هم با متن دلخواه شما!

این نوآوری که بر پایه معماری DiT (Diffusion Transformer) ساخته شده، بدون نیاز به آموزش اضافی (Zero-shot) کار می‌کنه و آینده جالبی برای تولید محتوای ویدیویی خلاقانه و شخصی‌سازی شده رقم می‌زنه. 🚀✨

منبع: arXiv AI