محققان در یک دستاورد تازه، متد جدیدی به نام «Scaled Weight Decay» معرفی کردهاند که میتواند انقلابی در بهینهسازی مدلهای بزرگ ایجاد کند. با ترکیب این روش با بهینهساز Muon (معروف به Muon-SW)، مدلهای Mixture-of-Experts تا ۳۰ درصد سریعتر به سطح دقت مورد نظر میرسند. این روش با مدیریت هوشمند نرخ کاهش وزنها، پایداری مدل را حفظ کرده و فرآیند آموزش را بهینهتر از همیشه میکند. گام بزرگی برای کاهش هزینهها و زمان آموزش مدلهای عظیم! 🧠💻
سازی
منبع: arXiv Machine Learning
