محققان در مقاله جدیدی به بررسی مشکلی پرداختهاند که در سیستمهای یادگیری تقویتی (Off-policy) رخ میدهد؛ جایی که استفاده مکرر از دادههای منفی باعث ایجاد «دفع بیش از حد» و ناپایداری در مدل میشود.
آنها با معرفی راهکار جدیدی به نام DRPO (Dynamic Remoteness-Aware Policy Optimization)، الگوریتمی طراحی کردهاند که هوشمندانه اثرات منفی دوردست را کنترل کرده و باعث بهبود عملکرد و پایداری مدلهای هوش مصنوعی میشود. این دستاورد به مدلها کمک میکند در محیطهای پیچیده، تصمیمات دقیقتر و پایدارتری بگیرند. 🧠✨
منبع: arXiv AI
