🚀 راهکار جدید برای آموزش هوشمندتر ایجنت‌های هوش مصنوعی (ProGPO)

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تا حالا به مشکل «تله شکست» (Credit Trap) در آموزش ایجنت‌های هوش مصنوعی فکر کردید؟ وقتی یک ایجنت روی کارهای طولانی‌مدت کار می‌کند، معمولاً در دام تکرار اقدامات بی‌فایده می‌افتد و سیستم پاداش هم به دلیل نبود نتیجه مثبت، نمی‌تواند به او مسیر درست را نشان دهد.

محققان در مقاله جدیدی روشی به نام ProGPO معرفی کرده‌اند که این مشکل را حل می‌کند. این الگوریتم وقتی ایجنت در مسیرهای بدون پاداش گیر می‌افتد، به جای ناامیدی، به حرکت به سمت «مشاهدات جدید» اولویت می‌دهد و به مراحلی که باعث کشف وضعیت‌های تازه می‌شوند، پاداش بیشتری می‌دهد.

این روش روی مدل‌های Qwen2.5 آزمایش شده و نشان داده که در محیط‌های پیچیده‌ای مثل ALFWorld و WebShop، عملکرد ایجنت‌ها به شکل چشمگیری بهتر می‌شود. گامی بزرگ برای رسیدن به ایجنت‌های مستقل‌تر و باهوش‌تر! 🤖✨

منبع: arXiv Machine Learning