محققان در تازهترین دستاورد خود، بهینهساز جدیدی به نام «LiMuon» را برای آموزش مدلهای بزرگ معرفی کردند. این ابزار که نسخهای بهینهتر از Muon است، با استفاده از تکنیکهای پیشرفتهای مثل SVD تصادفی، مشکل مصرف حافظه بالا و سرعت کم در مدلهای غولآسا را برطرف میکند.
نتایج آزمایشها روی مدلهای معروفی مثل Qwen2.5 نشان میدهد که LiMuon نه تنها سبکتر است، بلکه در فرآیند آموزش سرعت و دقت بسیار بهتری دارد. قدمی مهم برای توسعهدهندگانی که با مدلهای سنگین سر و کار دارند! 📈
منبع: arXiv Machine Learning
