محققان حوزه هوش مصنوعی راهکار جدیدی برای ارتقای عملکرد مدلهای «یادگیری تقویتی آفلاین» (Offline RL) معرفی کردند. تا پیش از این، «بهینهسازی سیاست مبتنی بر رفتار» (BRPO) عمدتاً از روشهای نامتقارن استفاده میکرد که گاهی با چالشهایی مثل ناپایداری عددی یا سوگیری همراه بود.
حالا با معرفی چارچوب «BRPO متقارن» (Symmetric BRPO)، دانشمندان موفق شدند با استفاده از سریهای نامتناهی واگراییهای پیرسون-واجدا، راهکاری ارائه دهند که:
✅ پایداری عددی بالاتری دارد.
✅ فرمولبندی بهینهتر و دقیقتری برای بهروزرسانی سیاستها فراهم میکند.
✅ در تستهای بنچمارک D4RL نتایج درخشان و مستحکمی از خود نشان داده است.
این پیشرفت گام مهمی برای بهبود عملکرد عاملهای هوشمند در محیطهای واقعی است که دادههای آموزشی آنها از پیش جمعآوری شده است.
منبع: arXiv AI
