همانطور که میدانید، بزرگتر کردن مدلهای زبانی (LLMs) با هزینههای محاسباتی سنگینی همراه است. اما محققان در مقالهای جدید، معماری نوآورانهای به نام «cMoLLM» را معرفی کردهاند که با استفاده از ترکیبی از روشهای «Mixture-of-Experts» (MoE) و کانولوشنهای پویا، ظرفیت مدل را بدون افزایش سرسامآور هزینهها، به شکلی بهینه گسترش میدهد.
این روش با تبدیل لایههای مخلوط به کانولوشنهای متغیر، باعث میشود مدل نه تنها عملکرد بهتری در درک زبان داشته باشد، بلکه در آموزش و استنتاج نیز پایدارتر و کارآمدتر عمل کند. گامی مهم برای دستیابی به مدلهای هوشمندتر با مصرف منابع بهینهتر! 🧠✨
منبع: arXiv AI
