محققان روش جدیدی به نام Turbo-Muon معرفی کردهاند که میتواند انقلابی در بهینهسازی و سرعت آموزش مدلهای بزرگ ایجاد کند! 📉
این روش با بهبود فرآیند محاسبات ماتریسی در الگوریتم Muon، نیاز به تکرارهای سنگین (Newton-Schulz) را کاهش داده و بدون افت کیفیت، زمان آموزش مدلهای هوش مصنوعی را تا ۳ درصد در بنچمارکهای مختلف کاهش میدهد. نکته جذاب اینجاست که این روش نیاز به تنظیمات پیچیده (Hyperparameter tuning) ندارد و به عنوان یک جایگزین ساده و سریع برای پروژههای یادگیری ماشین قابل استفاده است.
کدهای این پروژه هماکنون در گیتهاب و کتابخانههای محبوب HuggingFace در دسترس قرار گرفته است. 🛠
منبع: arXiv AI
