محققان بهتازگی بنچمارک جدیدی به نام WorkSurface-Bench را معرفی کردهاند که هدف آن ارزیابی دقیقتر «ایجنتهای هوش مصنوعی» در محیطهای کاری است. این ابزار بررسی میکند که آیا یک ایجنت میتواند منبع اطلاعاتی درست (بین اسناد متنی، جداول محاسباتی یا نمودارهای وابستگی) را برای پاسخ به سوالات پیچیده بهدرستی انتخاب کند یا خیر.
نکته جالب اینجاست که نتایج نشان میدهد حتی اگر ایجنت در «مسیریابی» و انتخاب منبع عالی عمل کند، باز هم در ارائه پاسخ نهایی چالشهایی دارد. این یعنی برای رسیدن به ایجنتهای کاملاً کاربردی در سازمانها، هنوز راه زیادی در پیش داریم! 📊💡
منبع: arXiv NLP
