محققان در مطالعه جدیدی به کالبدشکافی بهینهساز «Muon» پرداختهاند که به دلیل سرعت فوقالعادهاش در پدیده «Grokking» (فهم عمیق مدل از دادهها) شناخته میشود.
🔹 نکات کلیدی این پژوهش:
۱. عامل اصلی سرعت Muon، تکنیک «تعامد» (Orthogonalization) است، نه محدودیتهای طیفی!
۲. مدلهای مجهز به بهینهسازهای تعامدی، با کاهش ۳ برابری نرم طیفی به تعمیمیافتگی بهتری میرسند.
۳. کاهش تعداد تکرارهای نیوتن-شولز به ۱، سرعت را بالا میبرد اما پایداری مدل را در نرخ یادگیری بالا به شدت تهدید میکند.
این دستاورد نشان میدهد که برای ساخت مدلهای هوشمندتر و سریعتر، لزوماً نیازی به محاسبات پیچیده نیست؛ بلکه انتخاب درست در مکانیسمهای بهینهسازی حرف اول را میزند. 🧠⚙️
منبع: arXiv AI
