مدلهای زبانی Mixture-of-Experts (MoE) به دلیل استفاده از پارامترهای فعالشونده کم، بسیار کارآمد هستند، اما حافظه زیادی اشغال میکنند. حالا محققان متد جدیدی به نام MAESTRO معرفی کردهاند که با استفاده از زنجیرههای مارکوف، «کارشناسان غیرضروری» را شناسایی و حذف میکند.
نتایج این تحقیق نشان میدهد که MAESTRO بدون افت کیفیت چشمگیر و با حفظ کارایی بالا، میتواند این مدلهای سنگین را تا ۵۰٪ فشردهتر کند؛ گامی مهم برای اجرای مدلهای هوش مصنوعی بزرگ روی سختافزارهای محدودتر! 🛠️💻
منبع: arXiv NLP
