مدلهای ترنسفورمر (DiTs) که ستون فقرات تولید ویدیوهای خیرهکننده با هوش مصنوعی هستند، همیشه با چالش هزینه محاسباتی بالای «توجه» (Attention) روبرو بودهاند. حالا محققان با معرفی فریمورک «SVG-EAR»، این مانع بزرگ را دور زدهاند!
💡 نکته کلیدی این دستاورد چیست؟
این روش جدید بدون نیاز به آموزشهای سنگین یا آموزش مجدد، از یک سیستم «مسیریابی آگاه از خطا» استفاده میکند. SVG-EAR با خوشهبندی هوشمند دادهها، بخشهای مهم ویدیو را حفظ کرده و خطاهای ناشی از فشردهسازی را به شکلی دقیق جبران میکند. نتیجه؟ تولید ویدیو با سرعت بالاتر و بدون افت کیفیت محسوس! 🎬
این پیشرفت میتواند راه را برای خلق ویدیوهای طولانیتر و با کیفیتتر در مدلهای آینده باز کند.
منبع: arXiv Computer Vision
