محققان به تازگی یک مشکل فنی جدی در نحوه تعامل روشهای «آموزش مداوم» (Continual Learning) با بهینهساز معروف «آدام» (Adam) شناسایی کردهاند.
🔹 ماجرا چیست؟
بسیاری از روشهای بهینهسازی که برای یادگیری مداوم استفاده میشوند، گرادیانها را تغییر میدهند (مثلاً از طریق پروژکشن). تحقیق جدید نشان میدهد که وقتی این روشها با Adam ترکیب میشوند، باعث «تورم» در نرخ یادگیری شده و عملاً مدل دچار فراموشی فاجعهبار میشود.
🔹 راهکار چیست؟
محققان روش جدیدی به نام «Adaptive Decoupled Moment Routing» ارائه دادهاند که بدون تداخل با لحظات دوم (second-moment) بهینهساز آدام، گرادیانهای تغییریافته را مدیریت میکند. این تغییر ساده باعث پایداری بسیار بالاتر مدلها در مقیاسهای بزرگ (مثل مدلهای 7B با LoRA) شده است.
اگر در حوزه آموزش مدلهای زبانی یا یادگیری ماشین عمیق فعالیت میکنید، خواندن این مقاله فنی برای جلوگیری از افت دقت مدلهایتان ضروری است! 🚀
نویسی
منبع: arXiv AI
