اجرای مدلهای Mixture-of-Experts (MoE) روی دستگاههای لبه که منابع محدودی دارند، همیشه یک چالش بزرگ بوده. اما محققان به تازگی چارچوب جدیدی به نام «OrderMoE» معرفی کردند که با در نظر گرفتن شباهت عملکردی بین متخصصها (Experts)، حجم تبادل داده بین سرورها را به شدت کاهش میدهد.
این روش هوشمندانه با گروهبندی متخصصها و استفاده از یک الگوریتم انتخاب مسیر دقیق، باعث میشود بدون افت کیفیت، سرعت استنتاج مدلهای بزرگ در محیطهای محدود (مثل موبایل یا سرورهای لبه) بسیار بالاتر برود. تحولی جذاب برای سبکتر و سریعتر کردن هوش مصنوعی!
منبع: arXiv Machine Learning
