محققان ابزار جدیدی به نام DynamicMCPBench معرفی کردهاند که نحوه ارزیابی «ایجنتهای هوش مصنوعی» را متحول میکند. برخلاف روشهای قدیمی که فقط پاسخ نهایی را بررسی میکردند، این فریمورک با استفاده از پروتکل MCP، مدلها را در محیطهای زنده و بر اساس «تاثیرگذاری و اجرای گامبهگام» به چالش میکشد.
نکته جالب اینجاست که حتی قویترین مدلهای فعلی هم در حل کارهای پیچیده و طولانیمدت ضعف دارند؛ بهطوریکه با افزایش طول زنجیره دستورات، دقت آنها به شدت افت میکند. این بنچمارک به توسعهدهندگان اجازه میدهد تا عملکرد ایجنتهای خود را در محیطهای کاری شخصیسازی شده به دقت بسنجند.
آینده هوش مصنوعی در گرو توانایی اجرای درست «عملها» در دنیای واقعی است، نه فقط چت کردن! نظر شما چیست؟
منبع: arXiv AI
