🤖 حل چالش پایداری در یادگیری تقویتی چندعامله با کمک مدل‌های زبانی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

ترکیب هوش مصنوعی با یادگیری تقویتی (MARL) همیشه هیجان‌انگیز بوده، اما وقتی پای استفاده از مدل‌های زبانی (LLMs) برای تعیین پاداش‌ها وسط می‌آید، با چالش‌های فنی جالبی روبرو می‌شویم.

محققان در تحقیق جدید خود نشان دادند که تغییر دینامیک وزن‌های پاداش توسط LLMها می‌تواند ثبات سیستم را به هم بزند. آن‌ها برای حل این مشکل، دو استراتژی هوشمندانه ارائه کرده‌اند:
زمان‌بندی فاز-محور (Phase-Based Freeze): برای حفظ ثبات در مراحل آموزشی.
هموارسازی میانگین متحرک (EMA): برای جلوگیری از نوسانات شدید و ناگهانی در تصمیم‌گیری‌های عامل‌ها.

این متدها در محیط‌های پیچیده تست شده و توانسته‌اند نرخ موفقیت را به شکل چشم‌گیری افزایش دهند؛ گامی بزرگ برای هوشمندتر و پایدارتر کردن سیستم‌های چندعامله!

منبع: arXiv AI