آیا میدانستید معماریهای «ترکیب متخصصان» یا همان MoE که پایه و اساس مدلهای زبانی بزرگ امروزی هستند، با یک چالش فنی جدی در سطح شبکه مواجهاند؟
محققان در مقالهای جدید نشان دادهاند که زمانبندیِ چرخشی (Round-Robin) در این مدلها باعث ایجاد پدیدهای به نام «Incast» میشود که سرعت انتقال دادهها را بهشدت کاهش میدهد. حالا آنها یک راهکار پیشدستانه ارائه دادهاند که نه تنها این گلوگاه را حذف میکند، بلکه باعث میشود استفاده از پهنای باند شبکه به نزدیک ۱۰۰٪ برسد و زمان تکمیل عملیات (CCT) نیز بهطور قابل توجهی کاهش یابد. این یک گام بزرگ برای افزایش سرعت و کارایی پردازش مدلهای هوش مصنوعی در دیتاسنترهاست! ⚡️
منبع: arXiv Machine Learning
