🚀 بهینه‌سازی انقلابی برای مدل‌های غول‌پیکر MoE!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا می‌دانستید بخش بزرگی از حافظه گرافیکی شما در آموزش مدل‌های MoE صرفِ «Optimizer State» می‌شود؟ محققان به‌تازگی بهینه‌سازی جدیدی به نام SkewAdam معرفی کرده‌اند که این مشکل را حل می‌کند! 🧠

تکنیک SkewAdam با هوشمندی، وضعیت بهینه‌ساز را بر اساس نقش لایه‌ها (بک‌بون، متخصص‌ها و روتر) دسته‌بندی می‌کند. نتیجه این کار خارق‌العاده است:

📉 کاهش مصرف حافظه از ۸۱.۴ گیگابایت به ۳۱.۳ گیگابایت (تنها با ۲.۶٪ فضای اشغال‌شده توسط AdamW معمولی).
✅ عملکرد بهتر در دقت (Validation Perplexity) نسبت به AdamW و مدل‌های مشابه.

این یعنی حالا می‌توان مدل‌های بسیار بزرگ‌تر را روی سخت‌افزارهای محدودتری مثل کارت‌های ۴۰ گیگابایتی اجرا کرد. گامی بزرگ برای دموکراتیک‌تر کردن هوش مصنوعی! ⚡️

‌سازی

منبع: arXiv AI