تولید ویدیوها و محتوای باکیفیت توسط مدلهای ترنسفورمر دیفیوژن (DiT) همیشه با چالشهای سنگین پردازشی و هزینه بالای سختافزاری همراه بوده است. اما حالا محققان فریمورک جدیدی به نام DiTango را معرفی کردهاند که این بازی را تغییر میدهد!
💡 نکته طلایی: این مدل با استفاده از یک مکانیسم هوشمند برای «استفاده مجدد از دادههای توجه (Attention)»، باعث میشود محاسبات در محیطهای چندگانه به شدت بهینه شود.
نتایج آزمایشها فوقالعاده است:
✅ تا ۱.۹ برابر افزایش سرعت نهایی (End-to-End)
✅ تا ۳.۲ برابر سرعت بیشتر در لایههای توجه (Attention)
✅ حفظ کامل کیفیت تولید بدون افت دقت
این یعنی به زودی شاهد تولید ویدیوها و محتوای پیچیدهتر با سرعت بسیار بالاتر و هزینهای کمتر خواهیم بود! 🎥🔥
منبع: arXiv Computer Vision
