مدلهای زبانی Mixture-of-Experts (MoE) به دلیل کارایی بالا بسیار محبوب هستند، اما همیشه با چالش کمبود حافظه GPU دستوپنج نرم میکنند. حالا محققان روش جدیدی به نام PagedWeight را معرفی کردهاند که با مدیریت هوشمندانه و «کمیسازی وزنها» (Dynamic Weight Quantization) در لحظه اجرا، این محدودیتها را دور میزند.
ویژگیهای کلیدی این دستاورد:
✅ کاهش ۷۲ درصدی مصرف حافظه GPU.
✅ افزایش نزدیک به ۲ برابری سرعت (Throughput).
✅ حفظ دقت در سطح مدلهای FP16 با بهینهسازی دقیق بین حافظه و سرعت.
این روش به متخصصان کمک میکند تا مدلهای سنگین MoE را با هزینه بسیار کمتر و سرعت بسیار بالاتر روی سختافزارهای موجود اجرا کنند.
سازی
منبع: arXiv Machine Learning
