🧠 معمای بهینه‌سازی: چرا AdamW در آموزش شبکه‌های عصبی بهتر از SGD عمل می‌کند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جدید، تأثیر هایپرپارامترها و منظم‌ساز (Regularization) L2 را بر «منظره زیان» (Loss Landscape) شبکه‌های عصبی دو لایه ReLU بررسی کرده‌اند.

نکته جالب اینجاست که آزمایش‌ها نشان می‌دهد استفاده از بهینه‌ساز AdamW مانع از فروپاشی پارامترها به سمت صفر می‌شود، در حالی که SGD چنین قابلیتی ندارد. این مطالعه دریچه‌ای تازه به درک رفتارهای هندسی در مدل‌های یادگیری عمیق باز می‌کند که می‌تواند به بهینه‌سازی بهتر مدل‌های پیچیده کمک کند.

منبع: arXiv Machine Learning