🤖 پیشرفت در یادگیری تقویتی چندعامله (MARL) با مدل جدید ACPO

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان روشی نوآورانه به نام ACPO (Agent-Chained Policy Optimization) را معرفی کرده‌اند که چالش‌های اصلی هماهنگی میان عامل‌های هوشمند را حل می‌کند.

در سیستم‌های چندعامله، یادگیریِ همکاری به دلیل دشواریِ محاسبه گرادیان‌های سیاست (Policy Gradients) معمولاً با ناکارآمدی یا رسیدن به نتایج غیربهینه همراه است. متد جدید ACPO با ایجاد یک زنجیره از تصمیمات عامل‌ها و تجزیه دقیقِ گرادیان، اجازه می‌دهد هر عامل به طور مستقل اما در راستای هدف مشترک آموزش ببیند.

این مدل در آزمایش‌های شبیه‌سازی (مانند کنترل ربات‌های انبار و محیط‌های پیچیده)، عملکرد بسیار بهتری نسبت به روش‌های قبلی نشان داده و با افزایش تعداد عامل‌ها، کارایی آن بیش از پیش مشخص می‌شود. گامی رو به جلو برای دنیای رباتیک و سیستم‌های هوشمند همکار! 🚀

منبع: arXiv AI