محققان در مقالهای جدید، چارچوب نوآورانهای به نام CWAC (مخفف Collaborative Weighting Actor-Critic) را معرفی کردهاند که هدف آن حل یکی از بزرگترین چالشهای «یادگیری تقویتی خارج از سیاست» (Off-Policy RL) یعنی «بیشبرآوردی» (Overestimation Bias) است.
این مدل با ترکیب دو استراتژی هوشمندانه:
۱. استفاده از یک منتقد توزیعی برای مدلسازی عدم قطعیت در پیشبینیها
۲. مکانیزم وزندهی مشترک برای حذف نمونههای نویزدار و تکیه بر دادههای قابلاعتماد
توانسته است پایداری آموزش را در الگوریتمهای پرکاربردی مثل SAC و TD3 بهطور چشمگیری افزایش دهد. این پیشرفت میتواند در آینده منجر به رباتیک دقیقتر و سیستمهای خودکار قابلاعتمادتر شود.
منبع: arXiv AI
