آیا تا به حال شنیدهاید که مدلهای هوش مصنوعی مدتها پس از حفظ کردن دادههای آموزشی، تازه شروع به یادگیری و «تعمیم» (Generalization) میکنند؟ این پدیده که Grokking نام دارد، معمولاً بسیار زمانبر و غیرقابل پیشبینی است.
محققان در مقاله جدیدی با الهام از قوانین ترمودینامیک و مدلسازی توجه (Attention) به عنوان یک سیستم گرمایی، الگوریتم بهینهساز جدیدی به نام CvAdamW معرفی کردهاند. این روش با شناسایی هوشمند زمان «گذار فاز» در شبکه، نرخ وزندهی (Weight Decay) را تنظیم میکند تا مدل سریعتر و دقیقتر به مرحله تعمیم برسد.
نتایج این تحقیق نشان میدهد که با این روش میتوان علاوه بر کاهش زمان آموزش، پایداری یادگیری را در مدلهای عصبی به شکل چشمگیری افزایش داد. گامی کوچک اما مهم برای کاهش هزینههای سنگین آموزش مدلهای بزرگ!
منبع: arXiv Machine Learning
