محققان در مقاله جدیدی به سراغ یکی از چالشهای بزرگ در مدلهای تولید ویدیو (Video Generation) رفتهاند. مدلهای فعلی که از روش تقطیر (Distillation) استفاده میکنند، اغلب در حفظ تنوع و پوشش جزئیات دچار مشکل میشوند.
روش جدید «DistillAlign» با ترکیب دو رویکردِ «جستجوی مُد» و «حفظ تنوع»، باعث میشود مدلهای دانشآموز (Student Models) نه تنها کیفیت بصری بالاتری داشته باشند، بلکه خروجیهای متنوعتر و دقیقتری تولید کنند. این پیشرفت میتواند کیفیت ویدیوهای تولیدی توسط مدلهایی مثل Wan-1.3B را به شکل محسوسی ارتقا دهد. 🚀✨
منبع: arXiv Computer Vision
