ترکیب هوش مصنوعی با یادگیری تقویتی (MARL) همیشه هیجانانگیز بوده، اما وقتی پای استفاده از مدلهای زبانی (LLMs) برای تعیین پاداشها وسط میآید، با چالشهای فنی جالبی روبرو میشویم.
محققان در تحقیق جدید خود نشان دادند که تغییر دینامیک وزنهای پاداش توسط LLMها میتواند ثبات سیستم را به هم بزند. آنها برای حل این مشکل، دو استراتژی هوشمندانه ارائه کردهاند:
✅ زمانبندی فاز-محور (Phase-Based Freeze): برای حفظ ثبات در مراحل آموزشی.
✅ هموارسازی میانگین متحرک (EMA): برای جلوگیری از نوسانات شدید و ناگهانی در تصمیمگیریهای عاملها.
این متدها در محیطهای پیچیده تست شده و توانستهاند نرخ موفقیت را به شکل چشمگیری افزایش دهند؛ گامی بزرگ برای هوشمندتر و پایدارتر کردن سیستمهای چندعامله!
منبع: arXiv AI
