💡 کشف یک باگ پنهان در آموزش مداوم مدل‌های هوش مصنوعی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی یک مشکل فنی جدی در نحوه تعامل روش‌های «آموزش مداوم» (Continual Learning) با بهینه‌ساز معروف «آدام» (Adam) شناسایی کرده‌اند.

🔹 ماجرا چیست؟
بسیاری از روش‌های بهینه‌سازی که برای یادگیری مداوم استفاده می‌شوند، گرادیان‌ها را تغییر می‌دهند (مثلاً از طریق پروژکشن). تحقیق جدید نشان می‌دهد که وقتی این روش‌ها با Adam ترکیب می‌شوند، باعث «تورم» در نرخ یادگیری شده و عملاً مدل دچار فراموشی فاجعه‌بار می‌شود.

🔹 راهکار چیست؟
محققان روش جدیدی به نام «Adaptive Decoupled Moment Routing» ارائه داده‌اند که بدون تداخل با لحظات دوم (second-moment) بهینه‌ساز آدام، گرادیان‌های تغییریافته را مدیریت می‌کند. این تغییر ساده باعث پایداری بسیار بالاتر مدل‌ها در مقیاس‌های بزرگ (مثل مدل‌های 7B با LoRA) شده است.

اگر در حوزه آموزش مدل‌های زبانی یا یادگیری ماشین عمیق فعالیت می‌کنید، خواندن این مقاله فنی برای جلوگیری از افت دقت مدل‌هایتان ضروری است! 🚀

‌نویسی

منبع: arXiv AI