🚀 افزایش ۳۰ درصدی سرعت آموزش مدل‌های هوش مصنوعی با روشی جدید! ⚡️

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک دستاورد تازه، متد جدیدی به نام «Scaled Weight Decay» معرفی کرده‌اند که می‌تواند انقلابی در بهینه‌سازی مدل‌های بزرگ ایجاد کند. با ترکیب این روش با بهینه‌ساز Muon (معروف به Muon-SW)، مدل‌های Mixture-of-Experts تا ۳۰ درصد سریع‌تر به سطح دقت مورد نظر می‌رسند. این روش با مدیریت هوشمند نرخ کاهش وزن‌ها، پایداری مدل را حفظ کرده و فرآیند آموزش را بهینه‌تر از همیشه می‌کند. گام بزرگی برای کاهش هزینه‌ها و زمان آموزش مدل‌های عظیم! 🧠💻

‌سازی

منبع: arXiv Machine Learning