🚀 بهبود عملکرد ایجنت‌های هوش مصنوعی با متد جدید TRIAGE

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی، چارچوب نوآورانه‌ای به نام TRIAGE را برای تقویت یادگیری تقویتی (Reinforcement Learning) در ایجنت‌های خودمختار معرفی کرده‌اند.

مشکل اصلی مدل‌های فعلی (مثل GRPO) این است که پاداش‌ها را به‌صورت یکسان به تمام مراحل کار می‌دهند؛ یعنی کارهای مفید و اشتباهات کوچک ایجنت، همه با یک معیار سنجیده می‌شوند. روش TRIAGE با دسته‌بندی هوشمندِ اقدامات ایجنت (از جمله پیشرفت‌های سرنوشت‌ساز، اکتشافات مفید و حتی اقدامات بی‌فایده)، پاداش دقیق‌تری به مدل می‌دهد که منجر به کاهش خطا و افزایش چشمگیر نرخ موفقیت در محیط‌های پیچیده‌ای مثل WebShop و ALFWorld شده است.

این یعنی در آینده، ایجنت‌های هوش مصنوعی در محیط‌های واقعی، بسیار هوشمندانه‌تر و با خطای کمتری عمل خواهند کرد!

منبع: arXiv AI