مدلهای Mixture-of-Experts (MoE) به دلیل کارایی بالا بسیار محبوب هستند، اما معمولاً سنگین و پرهزینه اجرا میشوند. حالا محققان چارچوب جدیدی به نام PreMoE معرفی کردهاند که بدون نیاز به آموزش مجدد (Training-free)، این مدلها را برای کاربردهای خاص بهینه میکند.
ویژگیهای کلیدی PreMoE:
✅ استفاده از متریک PEU برای شناسایی اهمیت متخصصها در مدل.
✅ کاهش چشمگیر هزینههای محاسباتی (تا ۵۰٪ صرفهجویی) بدون افت عملکرد.
✅ انعطافپذیری بالا؛ از ساخت متخصصهای حوزهای تا مدلهای عمومی کارآمد.
این نوآوری راه را برای اجرای مدلهای بسیار بزرگ (تا ۷۱۸ میلیارد پارامتر) روی سختافزارهای محدودتر هموارتر میکند! 💡
سازی
منبع: arXiv Machine Learning
