مدلهای تولید ویدیوی فعلی اغلب با مشکل «شکاف گرادیان در حافظه» روبرو هستند؛ به این معنا که مدل نمیتواند به درستی از اطلاعات فریمهای قبلی برای تولید دقیقتر فریمهای آینده استفاده کند.
محققان در مقاله جدیدی، روشی نوآورانه به نام Self Gradient Forcing (SGF) را معرفی کردهاند. این تکنیک با استفاده از یک استراتژی آموزشی دو مرحلهای، به مدل یاد میدهد که چطور دادههای محیطی (Context) را به حافظه علی (Causal Memory) تبدیل کند تا ویدیوهای طولانیتر و با کیفیتتر، بدون پرشهای زمانی و با انسجام تصویری بسیار بالاتر تولید شوند. این پیشرفت میتواند کیفیت ویدیوهای ساخته شده توسط هوش مصنوعی را به شکلی چشمگیر بهبود ببخشد. 🎥✨
منبع: arXiv Computer Vision
