🚀 معرفی بنچمارک جدید برای تست واقعی هوش مصنوعی در کسب‌وکارها!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی بنچمارک جدیدی به نام ESF-Bench معرفی کرده‌اند که مخصوص سنجش توانایی مدل‌های زبانی (LLM) در «پر کردن اسلات‌ها» (Slot-Filling) برای کاربردهای واقعی و شرکتی طراحی شده است.

این بنچمارک با بررسی ۸ حوزه مختلف و ۵۷ سناریوی چالش‌برانگیز، نشان داده که حتی مدل‌های پیشرفته هم در محیط‌های پیچیده کاری دچار ضعف هستند (به طوری که برخی مدل‌ها تنها در ۲۰٪ موارد موفق عمل کرده‌اند!). اگر در حوزه توسعه محصولات مبتنی بر AI کار می‌کنید، بررسی این بنچمارک برای ارزیابی دقیق مدل‌هایتان بسیار کاربردی خواهد بود.

منبع، کدها و مجموعه داده این پروژه در گیت‌هاب منتشر شده است.

منبع: arXiv AI