🚀 معیار جدید برای ارزیابی هوش مصنوعی‌های عامل‌محور (Agentic AI) معرفی شد!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان ابزار جدیدی به نام E-Bench را برای سنجش توانایی مدل‌های زبانی در انجام کارهای چندمرحله‌ای و کار با ابزارها در محیط‌های دنیای واقعی طراحی کرده‌اند. برخلاف بنچمارک‌های قبلی، این ابزار ۳۲۳ سناریوی پیچیده و تعاملی را در پلتفرم‌هایی مثل QQ Music و Tencent Meeting شبیه‌سازی می‌کند.

نکته جالب اینجاست که حتی قوی‌ترین مدل‌های فعلی هم در انجام این وظایف چندمرحله‌ای با چالش جدی روبرو هستند و نرخ موفقیت آن‌ها هنوز زیر ۷۰ درصد باقی مانده است. این یعنی هنوز مسیر زیادی برای رسیدن به «عامل‌های هوشمند» کاملاً قابل اعتماد داریم. 🤖⚙️

منبع: arXiv AI