🚀 جهشی بزرگ در اجرای مدل‌های غول‌آسا: معرفی PagedWeight برای افزایش سرعت و کاهش هزینه! 🧠

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های زبانی Mixture-of-Experts (MoE) به دلیل کارایی بالا بسیار محبوب هستند، اما همیشه با چالش کمبود حافظه GPU دست‌وپنج نرم می‌کنند. حالا محققان روش جدیدی به نام PagedWeight را معرفی کرده‌اند که با مدیریت هوشمندانه و «کمی‌سازی وزن‌ها» (Dynamic Weight Quantization) در لحظه اجرا، این محدودیت‌ها را دور می‌زند.

ویژگی‌های کلیدی این دستاورد:
✅ کاهش ۷۲ درصدی مصرف حافظه GPU.
✅ افزایش نزدیک به ۲ برابری سرعت (Throughput).
✅ حفظ دقت در سطح مدل‌های FP16 با بهینه‌سازی دقیق بین حافظه و سرعت.

این روش به متخصصان کمک می‌کند تا مدل‌های سنگین MoE را با هزینه بسیار کمتر و سرعت بسیار بالاتر روی سخت‌افزارهای موجود اجرا کنند.

‌سازی

منبع: arXiv Machine Learning