محققان در پژوهشی جدید روشی نوآورانه به نام «Pats» (مخفف Policy-Aware Training Scaffolding) معرفی کردهاند که یادگیری تقویتشده (Reinforcement Learning) در مدلهای زبانی بزرگ را متحول میکند.
مشکل اصلی ایجنتهای فعلی این است که در مواجهه با کارهای پیچیده، مدام اشتباهات تکراری انجام میدهند. مدل Pats با استفاده از یک سیستم «داربست آموزشی»، به ایجنتها کمک میکند تا در مراحل اولیه آموزش، راهنماییهای دقیقتری دریافت کنند و با پیشرفت هوش مصنوعی، این کمکها بهطور هوشمند حذف شوند.
نتایج آزمایشها نشان میدهد که این روش نه تنها دقت عملکرد را در محیطهایی مثل ALFWorld تا ۱۸.۶٪ افزایش میدهد، بلکه با بهینهسازی توکنهای مصرفی، سرعت پاسخگویی را هم بهبود بخشیده است! گامی مهم به سوی ساخت ایجنتهای هوشمندتر و مستقلتر. 🤖💡
منبع: arXiv AI
