🔍 چطور دقت جستجوی «افراد» توسط هوش مصنوعی را بسنجیم؟ معرفی PeopleSearchBench

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

ابزارهای جستجوی هوشمند که برای استخدام، فروش و شبکه‌سازی استفاده می‌شوند، تا امروز معیار استانداردی برای ارزیابی نداشتند. حالا با معرفی بنچمارک متن‌باز «PeopleSearchBench»، این خلأ پر شده است! 🚀

این بنچمارک با استفاده از یک سیستم «تایید واقعیت» (Criteria-Grounded Verification)، نتایج جستجو را بر اساس فکت‌های وب می‌سنجد و نه فقط نظرات ذهنی مدل‌های زبانی. نتیجه جالب این تحقیق؟ عامل هوشمند «Lessie» با فاصله زیاد نسبت به رقبا، دقیق‌ترین عملکرد را داشته است.

اگر در حوزه توسعه ابزارهای جستجو یا استخدام فعال هستید، این بنچمارک جدید مرجع بسیار معتبری برای محک زدن دقت سیستم‌های شماست. 🛠

منبع: arXiv Machine Learning