تولید ویدیوهای طولانی و باکیفیت توسط مدلهای دیفیوژن همیشه با چالش «هزینه محاسباتی سنگین» روبرو بوده است. حالا محققان راهکار جدیدی به نام HyperVAttention (HVA) معرفی کردهاند که بدون نیاز به آموزش مجدد (Training-free)، سرعت و دقت تولید ویدیو را متحول میکند.
این روش با دو نوآوری کلیدی، گلوگاههای قبلی را رفع کرده است:
1️⃣ استفاده از خوشهبندی 3D محلی برای کاهش بار محاسباتی سنگین در محاسبات توجه (Attention).
2️⃣ بهینهسازی سختافزاری برای اجرای روانتر محاسبات روی کارتهای گرافیک.
با این دستاورد، احتمالاً بهزودی شاهد تولید ویدیوهای طولانیتر و با کیفیتتر در زمان کمتر خواهیم بود. 🎬✨
منبع: arXiv AI
