🚀 فشرده‌سازی هوشمندانه مدل‌های MoE با متد جدید MAESTRO! 🧠✨

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های زبانی Mixture-of-Experts (MoE) به دلیل استفاده از پارامترهای فعال‌شونده کم، بسیار کارآمد هستند، اما حافظه زیادی اشغال می‌کنند. حالا محققان متد جدیدی به نام MAESTRO معرفی کرده‌اند که با استفاده از زنجیره‌های مارکوف، «کارشناسان غیرضروری» را شناسایی و حذف می‌کند.

نتایج این تحقیق نشان می‌دهد که MAESTRO بدون افت کیفیت چشمگیر و با حفظ کارایی بالا، می‌تواند این مدل‌های سنگین را تا ۵۰٪ فشرده‌تر کند؛ گامی مهم برای اجرای مدل‌های هوش مصنوعی بزرگ روی سخت‌افزارهای محدودتر! 🛠️💻

منبع: arXiv NLP