یکی از چالشهای بزرگ در دنیای ایجنتهای هوشمند (AI Agents)، روشهای ارزیابی فعلی است که اغلب فقط به «موفقیت یا شکست» یک کار بسنده میکنند. این یعنی تفاوت بین یک راهحل اصولی و یک موفقیت شانسی نادیده گرفته میشود!
محققان برای حل این مشکل، متد جدیدی به نام Otap را معرفی کردهاند که با استفاده از «نظریه حملونقل بهینه» (Optimal Transport)، نحوه عملکرد ایجنتها را بر اساس گرافهای وابستگی تحلیل میکند. این روش هوشمندانه میتواند تشخیص دهد که آیا مسیر طی شده توسط ایجنت واقعاً منطقی بوده یا خیر، حتی اگر گامها جابهجا شده باشند. 🧠✨
این پیشرفت نویدبخشِ توسعهی ایجنتهای قابلاعتمادتر در آینده است که عملکردشان نه بر اساس شانس، بلکه بر اساس استدلال صحیح ارزیابی میشود.
منبع: arXiv AI
