محققان در دستاورد جدید خود، روشی به نام ProGPO را معرفی کردهاند که یادگیری تقویتی (RL) را در مدلهای زبانی عاملمحور (Agentic AI) بهینهتر میکند.
این روش با تمرکز بر «بهینهسازی گروهیِ سیاستها»، مشکلاتی که در مقایسه دقیق اقدامات مدل در طول مسیرهای طولانی وجود داشت را حل میکند. به زبان ساده، ProGPO باعث میشود ایجنتهای هوش مصنوعی در کارهای تعاملی پیچیده (مثل محیطهای شبیهسازی ALFWorld یا وبشاپ) تصمیمات هوشمندانهتر و دقیقتری بگیرند.
این پیشرفت گامی بزرگ برای رسیدن به ایجنتهای خودمختاری است که میتوانند کارهای چندمرحلهای را با دقت و ثبات بیشتری انجام دهند. 🔥
منبع: arXiv AI
