محققان در یک پژوهش جدید، تأثیر هایپرپارامترها و منظمساز (Regularization) L2 را بر «منظره زیان» (Loss Landscape) شبکههای عصبی دو لایه ReLU بررسی کردهاند.
نکته جالب اینجاست که آزمایشها نشان میدهد استفاده از بهینهساز AdamW مانع از فروپاشی پارامترها به سمت صفر میشود، در حالی که SGD چنین قابلیتی ندارد. این مطالعه دریچهای تازه به درک رفتارهای هندسی در مدلهای یادگیری عمیق باز میکند که میتواند به بهینهسازی بهتر مدلهای پیچیده کمک کند.
منبع: arXiv Machine Learning
