آیا تا به حال فکر کردهاید که چطور میتوان مدلهای زبانی حجیم (MoE) را که معمولاً به سختافزارهای سنگین نیاز دارند، روی موبایل یا سیستمهای معمولی اجرا کرد؟ 📱
محققان با معرفی DraftExpert، یک راهکار خلاقانه برای حل مشکل کندی در اجرای این مدلها ارائه کردهاند. چالش اصلی این بود که برای اجرای مدلهای Mixture-of-Experts روی دستگاههای نهایی (End-Device)، جابهجایی دادهها بین حافظه CPU و GPU زمان زیادی میبرد.
تکنیک جدید DraftExpert با آموزش یک «متخصص کوچک» (Draft Expert) در هر لایه مدل، به جای فراخوانی تمام متخصصهای سنگین، پیشبینیهای سریعی انجام میدهد. نتیجه؟
✅ افزایش ۱.۴۵ برابری سرعت تولید متن (Decode Throughput)
✅ نرخ پذیرش بالای ۸۵ درصد برای پیشبینیهای مدل
✅ بهینهسازی عالی برای اجرا روی موبایل و سیستمهای با حافظه محدود
این یعنی به زودی میتوانیم تجربهای بسیار سریعتر و هوشمندتر از مدلهای زبانی قدرتمند را مستقیماً روی گوشیهای موبایل خود داشته باشیم. 🧠✨
نویسی
منبع: arXiv Machine Learning
