محققان در مطالعهای جدید، چالش بزرگی را در الگوریتمهای «یادگیری تقویتی آفلاین» (Offline RL) هدف قرار دادهاند. مشکل اصلی اینجاست که در دنیای واقعی، بسیاری از اقدامات در دادهها ثبت نمیشوند و سیستمها با حدسهای نویزی روبهرو هستند.
حالا با معرفی الگوریتم LURE، دانشمندان توانستهاند با استفاده از متغیرهای وضعیت بعدی (Next-state)، این اقدامات پنهان را شناسایی کرده و نتایج دقیقتری در فرآیندهای تصمیمگیری (مانند مدیریت بیماران در بخش مراقبتهای ویژه) ارائه دهند. یک پیشرفت مهم برای مدلهایی که قرار است در محیطهای واقعی و پیچیده هوشمندانه عمل کنند. 🧠💡
منبع: arXiv Machine Learning
