محققان در پژوهش جدیدی به بررسی چالشهای مدلهای یادگیری تقویتی آفلاین (Offline RL) پرداختند. برخلاف باور رایج که میزان «بدبینی» (Pessimism) را عامل کلیدی در تعمیمپذیری میدانست، این مطالعه ثابت میکند که ساختارِ اعمالِ بدبینی بسیار مهمتر است.
نکته کلیدی این مقاله این است که اگر ساختارِ بدبینیِ مدل با تقارنهای مسئله همخوانی داشته باشد، مدل عملکرد بسیار بهتری خواهد داشت. آنها همچنین پیشنهاد میدهند استفاده از «افزایش داده» (Data Augmentation) در مرحله استخراج سیاست (Policy Extraction) میتواند نتایج بسیار دقیقتری نسبت به روشهای سنتی ایجاد کند.
این یافتهها گام مهمی برای بهینهتر کردن رباتها و سیستمهای خودکار در شرایط واقعی است.
منبع: arXiv Machine Learning
