محققان در مقاله جدیدی، چارچوب نوآورانهای به نام TRIAGE را برای تقویت یادگیری تقویتی (Reinforcement Learning) در ایجنتهای خودمختار معرفی کردهاند.
مشکل اصلی مدلهای فعلی (مثل GRPO) این است که پاداشها را بهصورت یکسان به تمام مراحل کار میدهند؛ یعنی کارهای مفید و اشتباهات کوچک ایجنت، همه با یک معیار سنجیده میشوند. روش TRIAGE با دستهبندی هوشمندِ اقدامات ایجنت (از جمله پیشرفتهای سرنوشتساز، اکتشافات مفید و حتی اقدامات بیفایده)، پاداش دقیقتری به مدل میدهد که منجر به کاهش خطا و افزایش چشمگیر نرخ موفقیت در محیطهای پیچیدهای مثل WebShop و ALFWorld شده است.
این یعنی در آینده، ایجنتهای هوش مصنوعی در محیطهای واقعی، بسیار هوشمندانهتر و با خطای کمتری عمل خواهند کرد!
منبع: arXiv AI
