محققان در یک پژوهش تازه، متد نوآورانهای برای حل یکی از چالشهای اساسی شبکههای عصبی عمیق (DQN) ارائه کردهاند. مسئله «ثبات در یادگیری» همیشه یکی از دغدغههای اصلی در RL بوده و حالا روش Memory Merge DQN با تغییر در نحوه بهروزرسانی پارامترهای شبکه هدف (Target Network)، دقت و پایداری آموزش را به شدت افزایش داده است.
این متد هوشمند به جای جایگزینی کامل پارامترها، از ترکیب وزنهای حساس استفاده میکند تا دانش مفید گذشته حفظ شود. نتایج آزمایشها در محیطهای Atari نشان میدهد که این روش جدید، عملکردی بهمراتب بهتر از روشهای کلاسیک مثل DQN و Averaged DQN دارد. 🔥
منبع: arXiv Machine Learning
