محققان به تازگی چارچوب نوآورانهای به نام «RAD» (مخفف Recurrent Autoregressive Diffusion) را معرفی کردهاند که مشکل حافظه در مدلهای ویدیوساز را حل میکند.
تا پیش از این، مدلهای اتورگرسیو برای تولید ویدیوهای بسیار طولانی با مشکل «فراموشی» جزئیات و ناسازگاریهای زمانی روبهرو بودند. اما با ترکیب لایههای حافظه موقت (RNN) در مدلهای ترنسفورمر و استفاده از پنجرههای زمانی همپوشانیدار، مدل جدید RAD میتواند بدون افت کیفیت، ویدیوهایی با حفظ جزئیات دقیق و پیوستگی فوقالعاده تولید کند. این دستاورد میتواند آینده تولید فیلم و انیمیشن توسط هوش مصنوعی را کاملاً دگرگون کند. 🚀
منبع: arXiv Computer Vision
