تولید ویدیوهای باکیفیت و طولانی همیشه با چالش کندی سرعت به دلیل محاسبات سنگین در مدلهای ترنسفورمر همراه بوده است. حالا محققان مکانیزم جدیدی به نام «NABLA» را معرفی کردهاند که با استفاده از «توجه تطبیقی در سطح بلوک» (Neighborhood Adaptive Block-Level Attention)، سرعت آموزش و استنتاج مدلهای تولید ویدیو را تا ۲.۷ برابر افزایش میدهد!
نکته جذاب اینجاست که این روش بدون افت کیفیت، روی معماریهای فعلی به خوبی عمل میکند و در دسترس برنامهنویسان قرار گرفته است. انقلابی در راه است که تولید ویدیو با هوش مصنوعی را بسیار سریعتر و بهینهتر از قبل خواهد کرد.
🔗 جزئیات بیشتر و دسترسی به کد:
https://github.com/gen-ai-team/Wan2.1-NABLA
منبع: arXiv Computer Vision
