محققان به تازگی بنچمارک جدیدی به نام HANDBOOK.md را معرفی کردهاند که یک چالش جدی برای مدلهای زبانی عاملمحور (Agentic AI) محسوب میشود. برخلاف تستهای معمولی، این بنچمارک بررسی میکند که آیا هوش مصنوعی واقعاً میتواند در طولانیمدت، به قوانین، دفترچههای راهنمای سازمانی و استانداردهای کاری (SOP) پایبند بماند یا خیر.
این تحقیق با استفاده از ۶۵ تسک در حوزههای مختلف مثل مالی، پزشکی و منابع انسانی، شبیهسازی میکند که یک «کارمند هوشمند» چطور باید در یک محیط کاری واقعی و با تکیه بر اسناد چند صد صفحهای، دستورالعملها را بدون خطا اجرا کند. این گامی بزرگ برای کاربردیتر کردن هوش مصنوعی در محیطهای اداری و سازمانی است. 💼✨
منبع: arXiv AI
