محققان در مقالهای جدید، چالش بزرگی در یادگیری تقویتی (Reinforcement Learning) را هدف قرار دادهاند: افت عملکرد رباتها در مواجهه با محیطهای نامطمئن و تغییرات لحظهای.
الگوریتم جدید «PPO-PGDLC» با ترکیب روش «تخمین گرادیان مستقیم» (PGD) و استفاده از یک «منتقد با قاعدهسازی لیپشیتز» (Lipschitz-regularized critic)، توانسته است مدلهایی بسازد که در دنیای واقعی بسیار پایدارتر و هوشمندتر عمل میکنند. آزمایشها روی رباتهای متحرک نشان میدهد که این روش جدید، حرکات نرمتر و دقیقتری را در شرایط پرمخاطره محیطی تضمین میکند. 🚀⚙️
منبع: arXiv Machine Learning
