🤖 معرفی بنچمارک جدید HANDBOOK.md: ارزیابی دقت هوش مصنوعی در اجرای دستورالعمل‌های سازمانی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی بنچمارک جدیدی به نام HANDBOOK.md را معرفی کرده‌اند که یک چالش جدی برای مدل‌های زبانی عامل‌محور (Agentic AI) محسوب می‌شود. برخلاف تست‌های معمولی، این بنچمارک بررسی می‌کند که آیا هوش مصنوعی واقعاً می‌تواند در طولانی‌مدت، به قوانین، دفترچه‌های راهنمای سازمانی و استانداردهای کاری (SOP) پایبند بماند یا خیر.

این تحقیق با استفاده از ۶۵ تسک در حوزه‌های مختلف مثل مالی، پزشکی و منابع انسانی، شبیه‌سازی می‌کند که یک «کارمند هوشمند» چطور باید در یک محیط کاری واقعی و با تکیه بر اسناد چند صد صفحه‌ای، دستورالعمل‌ها را بدون خطا اجرا کند. این گامی بزرگ برای کاربردی‌تر کردن هوش مصنوعی در محیط‌های اداری و سازمانی است. 💼✨

منبع: arXiv AI