محققان به تازگی گام مهمی در بهبود «یادگیری تقویتی» (Reinforcement Learning) برداشتهاند. در دنیای واقعی که با عدم قطعیت همراه است، مدیریت ریسک اهمیت حیاتی دارد. روش جدیدی به نام «UBSR-TD» معرفی شده که به هوش مصنوعی اجازه میدهد در محیطهای پویا، با دقت بیشتری سیاستهای خود را ارزیابی کند.
این روش به طور خاص برای مسائلی که با ریسکهای مالی یا مدیریت موجودی (که در آن عدم قطعیتِ زمان ماندگاری کالا وجود دارد) سر و کار دارند، بسیار کاربردی است. با این الگوریتم جدید، مدلهای هوش مصنوعی میتوانند با بهرهگیری از تقریب خطی، یادگیری کارآمدتری در محیطهای آنلاین داشته باشند. 📉📈
منبع: arXiv Machine Learning
