محققان در یک پژوهش جدید، چارچوب نوآورانه KE-DRL را معرفی کردهاند که یادگیری تقویتی توزیعی را در محیطهای چندبعدی متحول میکند. این روش با استفاده از نقشهبرداری در «فضای هیلبرت» (Hilbert Space)، مشکل محاسباتی پیچیده معیارهای واسرشتین (Wasserstein) را حل کرده و تخمینهای بسیار دقیقتری را در فرآیندهای تصمیمگیری پیچیده و مدیریت ریسک ممکن میسازد.
این دستاورد فنی، مسیر را برای هوش مصنوعی در محیطهای واقعی که با عدم قطعیت و متغیرهای پیوسته سر و کار دارند، هموارتر میکند. اگر به مباحث تخصصی RL علاقه دارید، این متد جدید میتواند تغییرات بزرگی در استراتژیهای آفلاین ایجاد کند.
منبع: arXiv Machine Learning
