دنیای هوش مصنوعی مولد دوباره شگفتزدهمان کرد! محققان به تازگی از چارچوب قدرتمند جدیدی به نام OmniCustom رونمایی کردهاند که یک گام فراتر از مدلهای قبلی است.
این مدل جدید چی کار میکنه؟
به جای اینکه فقط تصویر یا ویدیو تولید کنه، میتونه «هویت تصویری» و «لحن صوتی» رو به صورت همزمان شخصیسازی کنه. یعنی شما یک عکس مرجع و یک فایل صوتی به مدل میدید و اون ویدیویی تولید میکنه که هم دقیقاً شبیه اون تصویره و هم با صدای اون فایل صوتی صحبت میکنه؛ اون هم با متن دلخواه شما!
این نوآوری که بر پایه معماری DiT (Diffusion Transformer) ساخته شده، بدون نیاز به آموزش اضافی (Zero-shot) کار میکنه و آینده جالبی برای تولید محتوای ویدیویی خلاقانه و شخصیسازی شده رقم میزنه. 🚀✨
منبع: arXiv AI
