🚀 جهشی در سرعت آموزش مدل‌های غول‌آسا: بهینه‌سازی MoE با ترفند هم‌پوشانی! 🧠

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های Mixture-of-Experts (MoE) به دلیل ظرفیت بالا در مدل‌های زبانی بزرگ، حسابی سر و صدا کرده‌اند، اما گلوگاه اصلی آن‌ها «تاخیر ارتباطی» بین کارت‌های گرافیک است.

محققان در این مقاله، راهکار هوشمندانه‌ای برای حل این مشکل ارائه داده‌اند: آن‌ها با استفاده از تکنیک «هم‌پوشانیِ محاسبات و ارتباطات» (Computation-Communication Overlap) در سطح کاشی‌ها (Tile-level)، اجازه می‌دهند همزمان که پردازشِ داده‌ها انجام می‌شود، انتقال داده‌های بعدی نیز صورت بگیرد. این یعنی هدررفتِ منابع GPU به حداقل می‌رسد و مدل‌های سنگین با سرعت بسیار بالاتری اجرا می‌شوند. ⚡️

این نوآوری بدون نیاز به تغییرات پیچیده در کدنویسیِ هسته‌های اصلی، راه را برای اجرای سریع‌تر و بهینه‌تر مدل‌های ترلیون‌پارامتری هموارتر می‌کند.

منبع: arXiv AI