🚀 کشف رمز «Grokking»: راهکاری جدید برای تعمیم بهتر در شبکه‌های عصبی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا تا به حال شنیده‌اید که مدل‌های هوش مصنوعی مدت‌ها پس از حفظ کردن داده‌های آموزشی، تازه شروع به یادگیری و «تعمیم» (Generalization) می‌کنند؟ این پدیده که Grokking نام دارد، معمولاً بسیار زمان‌بر و غیرقابل پیش‌بینی است.

محققان در مقاله جدیدی با الهام از قوانین ترمودینامیک و مدل‌سازی توجه (Attention) به عنوان یک سیستم گرمایی، الگوریتم بهینه‌ساز جدیدی به نام CvAdamW معرفی کرده‌اند. این روش با شناسایی هوشمند زمان «گذار فاز» در شبکه، نرخ وزن‌دهی (Weight Decay) را تنظیم می‌کند تا مدل سریع‌تر و دقیق‌تر به مرحله تعمیم برسد.

نتایج این تحقیق نشان می‌دهد که با این روش می‌توان علاوه بر کاهش زمان آموزش، پایداری یادگیری را در مدل‌های عصبی به شکل چشمگیری افزایش داد. گامی کوچک اما مهم برای کاهش هزینه‌های سنگین آموزش مدل‌های بزرگ!

منبع: arXiv Machine Learning