📊 بنچمارک جدید برای ارزیابی هوش مصنوعی در دنیای بیمه و محاسبات اکچوئری!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک پژوهش جدید، مجموعه داده و بنچمارک جامع «INS-ActBench» را معرفی کرده‌اند که به طور خاص برای سنجش توانمندی‌های مدل‌های زبانی (LLM) در حوزه تخصصی بیمه و اکچوئری طراحی شده است.

این بنچمارک با داشتن بیش از ۱۲ هزار سوال استاندارد، ابزارهای کدنویسی و تحلیل پرونده، به ما کمک می‌کند تا بفهمیم مدل‌های هوش مصنوعی تا چه حد در تصمیم‌گیری‌های پیچیده مالی و بیمه‌ای قابل اعتماد هستند. نتایج نشان می‌دهد که مدل‌های فعلی در دانش تئوری عالی عمل می‌کنند، اما در اجرای وظایف عملیاتی و تحلیل‌های موردی هنوز راه زیادی در پیش دارند.

منبع باز این پروژه برای توسعه‌دهندگان در دسترس است.

منبع: arXiv NLP