تا حالا به مشکل «تله شکست» (Credit Trap) در آموزش ایجنتهای هوش مصنوعی فکر کردید؟ وقتی یک ایجنت روی کارهای طولانیمدت کار میکند، معمولاً در دام تکرار اقدامات بیفایده میافتد و سیستم پاداش هم به دلیل نبود نتیجه مثبت، نمیتواند به او مسیر درست را نشان دهد.
محققان در مقاله جدیدی روشی به نام ProGPO معرفی کردهاند که این مشکل را حل میکند. این الگوریتم وقتی ایجنت در مسیرهای بدون پاداش گیر میافتد، به جای ناامیدی، به حرکت به سمت «مشاهدات جدید» اولویت میدهد و به مراحلی که باعث کشف وضعیتهای تازه میشوند، پاداش بیشتری میدهد.
این روش روی مدلهای Qwen2.5 آزمایش شده و نشان داده که در محیطهای پیچیدهای مثل ALFWorld و WebShop، عملکرد ایجنتها به شکل چشمگیری بهتر میشود. گامی بزرگ برای رسیدن به ایجنتهای مستقلتر و باهوشتر! 🤖✨
منبع: arXiv Machine Learning



