🚀 پیشرفت چشمگیر در یادگیری تقویتی چندعامله (MARL) با فریم‌ورک SAFE

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک دستاورد جدید، فریم‌ورک نوآورانه «SAFE» را برای حل چالش‌های یادگیری تقویتی در محیط‌های با فضای کنش پیوسته معرفی کردند. 🤖✨

تا پیش از این، استفاده از روش‌های «اعتبارگذاری خلاف‌واقع» (Counterfactual credit assignment) در فضاهای کنش پیوسته با مشکلاتی مثل بایاس در گرادیان‌ها همراه بود، اما SAFE با استفاده از یک «کنش پیش‌فرض خودتکامل‌یافته»، این مشکل را بدون نیاز به شبیه‌سازی‌های اضافه یا مدل‌های پاداش پیچیده حل کرده است.

این مدل که به‌ویژه در وظایف ترافیکی و همکاری وسایل نقلیه هوشمند عملکرد درخشانی داشته، گام بزرگی برای هوشمندتر شدن سیستم‌های چندعامله در دنیای واقعی است. 🚗🛣️

منبع: arXiv Machine Learning