آیا میدانستید بخش بزرگی از حافظه گرافیکی شما در آموزش مدلهای MoE صرفِ «Optimizer State» میشود؟ محققان بهتازگی بهینهسازی جدیدی به نام SkewAdam معرفی کردهاند که این مشکل را حل میکند! 🧠
تکنیک SkewAdam با هوشمندی، وضعیت بهینهساز را بر اساس نقش لایهها (بکبون، متخصصها و روتر) دستهبندی میکند. نتیجه این کار خارقالعاده است:
📉 کاهش مصرف حافظه از ۸۱.۴ گیگابایت به ۳۱.۳ گیگابایت (تنها با ۲.۶٪ فضای اشغالشده توسط AdamW معمولی).
✅ عملکرد بهتر در دقت (Validation Perplexity) نسبت به AdamW و مدلهای مشابه.
این یعنی حالا میتوان مدلهای بسیار بزرگتر را روی سختافزارهای محدودتری مثل کارتهای ۴۰ گیگابایتی اجرا کرد. گامی بزرگ برای دموکراتیکتر کردن هوش مصنوعی! ⚡️
سازی
منبع: arXiv AI
