محققان به تازگی بنچمارک جدیدی به نام ESF-Bench معرفی کردهاند که مخصوص سنجش توانایی مدلهای زبانی (LLM) در «پر کردن اسلاتها» (Slot-Filling) برای کاربردهای واقعی و شرکتی طراحی شده است.
این بنچمارک با بررسی ۸ حوزه مختلف و ۵۷ سناریوی چالشبرانگیز، نشان داده که حتی مدلهای پیشرفته هم در محیطهای پیچیده کاری دچار ضعف هستند (به طوری که برخی مدلها تنها در ۲۰٪ موارد موفق عمل کردهاند!). اگر در حوزه توسعه محصولات مبتنی بر AI کار میکنید، بررسی این بنچمارک برای ارزیابی دقیق مدلهایتان بسیار کاربردی خواهد بود.
منبع، کدها و مجموعه داده این پروژه در گیتهاب منتشر شده است.
منبع: arXiv AI
