محققان در مقالهای جدید، چالشهای مربوط به بهینهساز معروف Muon در آموزش مدلهای زبانی بزرگ را بررسی کردند. مشکل اصلی اینجاست که در طول آموزش، مقادیر وزنها به شکلی نامتوازن رشد میکنند که میتواند پایداری مدل را تحت تأثیر قرار دهد.
این تیم یک روش جدید به نام «Spectral Cap» معرفی کردهاند که با کنترل هوشمند تغییرات در جهات اصلی ماتریسهای وزن، بدون متوقف کردن فرایند یادگیری، تعادل و همگرایی مدل را افزایش میدهد. این دستاورد به ویژه برای بهبود عملکرد مدلهای مبتنی بر معماریهای جدید مثل Mixture-of-Experts و FlashAttention بسیار کاربردی است. 📈
سازی
منبع: arXiv Machine Learning
