حتماً میدانید که مدلهای غولپیکر Mixture-of-Experts (MoE) به دلیل حجم بالا، روی سختافزارهای موبایل چالشبرانگیز هستند. حالا محققان روشی به نام «SpecPrefetch» را معرفی کردهاند که مشکل اصلی یعنی تاخیر در بارگذاری متخصصها (Experts) را حل میکند.
این روش با پیشبینی هوشمندانه و پیشبارگذاری متخصصها در حافظه، بدون تغییر در ساختار اصلی مدل، سرعت استنتاج را به شدت بالا میبرد. جالبتر اینکه این متد روی دستگاههایی مثل Snapdragon 8 Elite عملکرد فوقالعادهای نشان داده است! با این دستاورد، اجرای مدلهای بسیار قدرتمند روی گوشیهای ما به واقعیت نزدیکتر شده است. 📱✨
منبع: arXiv AI
