محققان ابزار جدیدی به نام E-Bench را برای سنجش توانایی مدلهای زبانی در انجام کارهای چندمرحلهای و کار با ابزارها در محیطهای دنیای واقعی طراحی کردهاند. برخلاف بنچمارکهای قبلی، این ابزار ۳۲۳ سناریوی پیچیده و تعاملی را در پلتفرمهایی مثل QQ Music و Tencent Meeting شبیهسازی میکند.
نکته جالب اینجاست که حتی قویترین مدلهای فعلی هم در انجام این وظایف چندمرحلهای با چالش جدی روبرو هستند و نرخ موفقیت آنها هنوز زیر ۷۰ درصد باقی مانده است. این یعنی هنوز مسیر زیادی برای رسیدن به «عاملهای هوشمند» کاملاً قابل اعتماد داریم. 🤖⚙️
منبع: arXiv AI
