محققان در مقاله جدیدی، الگوریتم نوآورانه «CDCPG» را معرفی کردهاند که تحولی در یادگیری تقویتی برای سیستمهای پیچیده با فضای حالت و عمل پیوسته ایجاد میکند.
این روش با تمرکز بر تعاملات محلی در گرافهای شبکهای، مشکل عدم تطابق در تخمینگرهای ارزش (Critic) را حل کرده و پایداری یادگیری را در محیطهای توزیعشده به شدت افزایش میدهد. این دستاورد گامی بزرگ برای هوش مصنوعی در مدیریت رباتهای گروهی و سیستمهای هوشمند مقیاسپذیر است. 🤖⚙️
منبع: arXiv Machine Learning
