در دنیای Agentic Reinforcement Learning، یکی از بزرگترین چالشها این است که مدلها نمیدانند کدام بخش از کارهایشان واقعاً باعث موفقیت یا شکست شده است. سیستمهای فعلی مثل GRPO معمولاً کل مسیر را با یک نتیجه نهایی میسنجند که باعث میشود کارهای مفیدِ میانه مسیر نادیده گرفته شوند.
محققان با معرفی متد جدید «TRIAGE»، این مشکل را حل کردهاند. این چارچوب با دستهبندی هوشمندانه اقدامات مدل (مانند پیشرفت قاطع، جستجوی مفید یا حتی خطا)، امتیازدهی را بسیار دقیقتر کرده است. نتیجه؟ یادگیری سریعتر، دقیقتر و کاهش خطاهای مدل در محیطهای پیچیدهای مثل ALFWorld و WebShop.
این یعنی در آینده، ایجنتهای هوش مصنوعی با درک بهتری از «فرآیند کار»، کمتر اشتباه میکنند! 🚀
منبع: arXiv AI
