🚀 بهینه‌سازی سیاست‌ها در یادگیری تقویتی آفلاین با رویکرد جدید متقارن! 🧠🤖

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان حوزه هوش مصنوعی راهکار جدیدی برای ارتقای عملکرد مدل‌های «یادگیری تقویتی آفلاین» (Offline RL) معرفی کردند. تا پیش از این، «بهینه‌سازی سیاست مبتنی بر رفتار» (BRPO) عمدتاً از روش‌های نامتقارن استفاده می‌کرد که گاهی با چالش‌هایی مثل ناپایداری عددی یا سوگیری همراه بود.

حالا با معرفی چارچوب «BRPO متقارن» (Symmetric BRPO)، دانشمندان موفق شدند با استفاده از سری‌های نامتناهی واگرایی‌های پیرسون-واجدا، راهکاری ارائه دهند که:
✅ پایداری عددی بالاتری دارد.
✅ فرمول‌بندی بهینه‌تر و دقیق‌تری برای به‌روزرسانی سیاست‌ها فراهم می‌کند.
✅ در تست‌های بنچمارک D4RL نتایج درخشان و مستحکمی از خود نشان داده است.

این پیشرفت گام مهمی برای بهبود عملکرد عامل‌های هوشمند در محیط‌های واقعی است که داده‌های آموزشی آن‌ها از پیش جمع‌آوری شده است.

منبع: arXiv AI