دنیای بهینهسازهای هوش مصنوعی یک قدم به جلو حرکت کرد! محققان به تازگی الگوریتم جدیدی به نام ELO (Efficient Long-hOrizon) را معرفی کردهاند که بهینهسازی مدلها را در بازههای طولانی به شدت کارآمدتر میکند.
نکته کلیدی اینجاست که ELO نه تنها با مصرف منابع کمتر (کمتر از ۷ کارت H100) آموزش میبیند، بلکه در تستهای عملی روی مدلهای زبانی (مثل GPT-2) و بینایی ماشین (مثل ViT و ResNet)، عملکردی بهتر از AdamW ارائه داده و پابهپای Muon حرکت میکند. این یعنی مسیر برای رسیدن به مدلهای دقیقتر و سریعتر هموارتر شده است! 🧠✨
منبع: arXiv Machine Learning
