محققان در پژوهشی جدید، تحلیل دقیقی از عملکرد اپتیمایزر نوظهور «Muon» ارائه کردهاند. بیشتر اپتیمایزرهای رایج، پارامترهای ماتریسی مدلها را به صورت بردار (Flatten) پردازش میکنند، اما Muon با رویکردی متفاوت، ساختار ماتریسی را حفظ کرده و در آموزش شبکههای عصبی عملکردی فراتر از اپتیمایزرهای کلاسیک (مانند GD) دارد.
نتایج این تحقیق نشان میدهد که Muon به دلیل بهرهگیری از ساختار «رتبه پایین» (Low-rank) ماتریس هسین، میتواند سرعت و دقت آموزش را به شدت افزایش دهد. این دستاورد، گامی مهم در ارتقای بهینهسازی مدلهای سنگین هوش مصنوعی است. 🤖✨
سازی
منبع: arXiv Machine Learning
