🚀 راز بهینه‌ساز Muon در یادگیری عمیق فاش شد!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مطالعه جدیدی به کالبدشکافی بهینه‌ساز «Muon» پرداخته‌اند که به دلیل سرعت فوق‌العاده‌اش در پدیده «Grokking» (فهم عمیق مدل از داده‌ها) شناخته می‌شود.

🔹 نکات کلیدی این پژوهش:
۱. عامل اصلی سرعت Muon، تکنیک «تعامد» (Orthogonalization) است، نه محدودیت‌های طیفی!
۲. مدل‌های مجهز به بهینه‌سازهای تعامدی، با کاهش ۳ برابری نرم طیفی به تعمیم‌یافتگی بهتری می‌رسند.
۳. کاهش تعداد تکرارهای نیوتن-شولز به ۱، سرعت را بالا می‌برد اما پایداری مدل را در نرخ یادگیری بالا به شدت تهدید می‌کند.

این دستاورد نشان می‌دهد که برای ساخت مدل‌های هوشمندتر و سریع‌تر، لزوماً نیازی به محاسبات پیچیده نیست؛ بلکه انتخاب درست در مکانیسم‌های بهینه‌سازی حرف اول را می‌زند. 🧠⚙️

منبع: arXiv AI