تا امروز، اجرای مدلهای ویدیویی عظیم با بیش از ۱۰۰ میلیارد پارامتر، به خاطر مصرف وحشتناک حافظه، نیازمند کلاسترهای گرانقیمتِ GPU بود. اما محققان با معرفی «MegaSlide-DiT» این معادله را تغییر دادهاند!
💡 نکته کلیدی این نوآوری کجاست؟
۱. مدیریت هوشمند حافظه: مدل به جای اشغال تمام فضای گرافیک، فقط بخشهای ضروری را به صورت لحظهای از رم سیستم (Host RAM) به حافظه کارت گرافیک منتقل میکند.
۲. کاهش پیچیدگی محاسباتی: با استفاده از یک تکنیک جدید به نام «3D Deformable Slide Attention»، هزینههای محاسباتی به جای رشد مربعی، به صورت خطی کاهش یافته است.
نتیجه؟ حالا میتوان یک مدل ۱۰۵ میلیارد پارامتری را تنها با یک کارت گرافیک H200 و حافظه سیستمی کافی، بهینهسازی کرد. گامی بزرگ برای دموکراتیزه کردن هوش مصنوعی مولد در مقیاسهای بزرگ! ⚡️
منبع: arXiv Computer Vision
