محققان در مقالهای جدید، مدل SANA-Video 2.0 را معرفی کردهاند که یک ترنسفورمر ویدئویی ترکیبی است. این مدل با معماری هوشمندانه خود (Hybrid Linear-Softmax)، توانسته مشکل کند بودن پردازش ویدیوهای طولانی را حل کند.
ویژگیهای کلیدی:
✅ تولید ویدیو تا رزولوشن 720p روی یک GPU تکی
✅ سرعت 3.2 برابر بیشتر نسبت به مدلهای استاندارد (Softmax)
✅ کارایی بسیار بالا در تولید ویدیوهای باکیفیت و طولانیتر
این یعنی در آینده نزدیک، ابزارهای تولید محتوای ویدیویی با هوش مصنوعی، بسیار سریعتر و در دسترستر خواهند شد. نظر شما درباره سرعت پیشرفت مدلهای ویدیویی چیست؟
منبع: arXiv Computer Vision
