محققان در یک دستاورد جدید، فریمورک نوآورانه «SAFE» را برای حل چالشهای یادگیری تقویتی در محیطهای با فضای کنش پیوسته معرفی کردند. 🤖✨
تا پیش از این، استفاده از روشهای «اعتبارگذاری خلافواقع» (Counterfactual credit assignment) در فضاهای کنش پیوسته با مشکلاتی مثل بایاس در گرادیانها همراه بود، اما SAFE با استفاده از یک «کنش پیشفرض خودتکاملیافته»، این مشکل را بدون نیاز به شبیهسازیهای اضافه یا مدلهای پاداش پیچیده حل کرده است.
این مدل که بهویژه در وظایف ترافیکی و همکاری وسایل نقلیه هوشمند عملکرد درخشانی داشته، گام بزرگی برای هوشمندتر شدن سیستمهای چندعامله در دنیای واقعی است. 🚗🛣️
منبع: arXiv Machine Learning
