🚀 انقلابی در آموزش مدل‌های عظیم ویدیویی؛ با MegaSlide-DiT، غول‌ها را روی کارت گرافیک خانگی رام کنید! 🎥

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا امروز، اجرای مدل‌های ویدیویی عظیم با بیش از ۱۰۰ میلیارد پارامتر، به خاطر مصرف وحشتناک حافظه، نیازمند کلاسترهای گران‌قیمتِ GPU بود. اما محققان با معرفی «MegaSlide-DiT» این معادله را تغییر داده‌اند!

💡 نکته کلیدی این نوآوری کجاست؟
۱. مدیریت هوشمند حافظه: مدل به جای اشغال تمام فضای گرافیک، فقط بخش‌های ضروری را به صورت لحظه‌ای از رم سیستم (Host RAM) به حافظه کارت گرافیک منتقل می‌کند.
۲. کاهش پیچیدگی محاسباتی: با استفاده از یک تکنیک جدید به نام «3D Deformable Slide Attention»، هزینه‌های محاسباتی به جای رشد مربعی، به صورت خطی کاهش یافته است.

نتیجه؟ حالا می‌توان یک مدل ۱۰۵ میلیارد پارامتری را تنها با یک کارت گرافیک H200 و حافظه سیستمی کافی، بهینه‌سازی کرد. گامی بزرگ برای دموکراتیزه کردن هوش مصنوعی مولد در مقیاس‌های بزرگ! ⚡️

منبع: arXiv Computer Vision