🚀 یادگیری تقویت‌شده در ایجنت‌های هوشمند با تکنیک جدید Pats

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی جدید روشی نوآورانه به نام «Pats» (مخفف Policy-Aware Training Scaffolding) معرفی کرده‌اند که یادگیری تقویت‌شده (Reinforcement Learning) در مدل‌های زبانی بزرگ را متحول می‌کند.

مشکل اصلی ایجنت‌های فعلی این است که در مواجهه با کارهای پیچیده، مدام اشتباهات تکراری انجام می‌دهند. مدل Pats با استفاده از یک سیستم «داربست آموزشی»، به ایجنت‌ها کمک می‌کند تا در مراحل اولیه آموزش، راهنمایی‌های دقیق‌تری دریافت کنند و با پیشرفت هوش مصنوعی، این کمک‌ها به‌طور هوشمند حذف شوند.

نتایج آزمایش‌ها نشان می‌دهد که این روش نه تنها دقت عملکرد را در محیط‌هایی مثل ALFWorld تا ۱۸.۶٪ افزایش می‌دهد، بلکه با بهینه‌سازی توکن‌های مصرفی، سرعت پاسخگویی را هم بهبود بخشیده است! گامی مهم به سوی ساخت ایجنت‌های هوشمندتر و مستقل‌تر. 🤖💡

منبع: arXiv AI