محققان روشی نوآورانه به نام ACPO (Agent-Chained Policy Optimization) را معرفی کردهاند که چالشهای اصلی هماهنگی میان عاملهای هوشمند را حل میکند.
در سیستمهای چندعامله، یادگیریِ همکاری به دلیل دشواریِ محاسبه گرادیانهای سیاست (Policy Gradients) معمولاً با ناکارآمدی یا رسیدن به نتایج غیربهینه همراه است. متد جدید ACPO با ایجاد یک زنجیره از تصمیمات عاملها و تجزیه دقیقِ گرادیان، اجازه میدهد هر عامل به طور مستقل اما در راستای هدف مشترک آموزش ببیند.
این مدل در آزمایشهای شبیهسازی (مانند کنترل رباتهای انبار و محیطهای پیچیده)، عملکرد بسیار بهتری نسبت به روشهای قبلی نشان داده و با افزایش تعداد عاملها، کارایی آن بیش از پیش مشخص میشود. گامی رو به جلو برای دنیای رباتیک و سیستمهای هوشمند همکار! 🚀
منبع: arXiv AI
