🚀 بهینه‌سازی آموزش مدل‌های زبانی: معرفی راهکار جدید برای بهینه‌سازی Muon! 🧠

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای جدید، چالش‌های مربوط به بهینه‌ساز معروف Muon در آموزش مدل‌های زبانی بزرگ را بررسی کردند. مشکل اصلی اینجاست که در طول آموزش، مقادیر وزن‌ها به شکلی نامتوازن رشد می‌کنند که می‌تواند پایداری مدل را تحت تأثیر قرار دهد.

این تیم یک روش جدید به نام «Spectral Cap» معرفی کرده‌اند که با کنترل هوشمند تغییرات در جهات اصلی ماتریس‌های وزن، بدون متوقف کردن فرایند یادگیری، تعادل و هم‌گرایی مدل را افزایش می‌دهد. این دستاورد به ویژه برای بهبود عملکرد مدل‌های مبتنی بر معماری‌های جدید مثل Mixture-of-Experts و FlashAttention بسیار کاربردی است. 📈

‌سازی

منبع: arXiv Machine Learning