مدلهای Mixture-of-Experts (MoE) به دلیل ظرفیت بالا در مدلهای زبانی بزرگ، حسابی سر و صدا کردهاند، اما گلوگاه اصلی آنها «تاخیر ارتباطی» بین کارتهای گرافیک است.
محققان در این مقاله، راهکار هوشمندانهای برای حل این مشکل ارائه دادهاند: آنها با استفاده از تکنیک «همپوشانیِ محاسبات و ارتباطات» (Computation-Communication Overlap) در سطح کاشیها (Tile-level)، اجازه میدهند همزمان که پردازشِ دادهها انجام میشود، انتقال دادههای بعدی نیز صورت بگیرد. این یعنی هدررفتِ منابع GPU به حداقل میرسد و مدلهای سنگین با سرعت بسیار بالاتری اجرا میشوند. ⚡️
این نوآوری بدون نیاز به تغییرات پیچیده در کدنویسیِ هستههای اصلی، راه را برای اجرای سریعتر و بهینهتر مدلهای ترلیونپارامتری هموارتر میکند.
منبع: arXiv AI
