محققان به تازگی در مقاله جدیدی، برای اولین بار موفق به ارائه تضمینهای تئوریک برای الگوریتمهای «یادگیری تقلیدی خصمانه» (AIL) در حالت Off-policy شدهاند.
مشکل اصلی در این الگوریتمها، ناکارآمدی در مصرف دادهها (Sample Inefficiency) به دلیل نیاز به دادههای On-policy بود. اما این پژوهش جدید نشان میدهد که با استفاده از دادههای قدیمیتر، نه تنها دقت کاهش نمییابد، بلکه مشکل تغییر توزیع (Distribution Shift) نیز تحت کنترل درآمده و کارایی مدل به طرز چشمگیری افزایش مییابد. این خبر برای پژوهشگران حوزه یادگیری تقویتی (RL) یک جهش بزرگ محسوب میشود! 🔥
منبع: arXiv Machine Learning
