محققان در مقاله جدید خود به سراغ یکی از مفاهیم پیچیده و مهم در آموزش شبکههای عصبی رفتهاند: «فضای مسلط» (Dominant Subspace) در گرادیانها.
آیا تا به حال فکر کردهاید که چرا مدلها هنگام آموزش با SGD (گرادیان کاهشی تصادفی) رفتار متفاوتی در سطح صاف یا تندِ تابع هزینه دارند؟ این پژوهش نشان میدهد که نویزِ موجود در دستههای کوچک (Mini-batch) برخلاف تصور، نقش مهمی در کنترل این «تندی» (Sharpness) ایفا میکند و در واقع به بهینهسازی دقیقتر مدل کمک میکند. این کشف میتواند راهگشای طراحی الگوریتمهای بهینهساز سریعتر و پایدارتر در آینده باشد. 🚀📈
سازی
منبع: arXiv Machine Learning
