محققان در یک پژوهش جدید، مجموعه داده و بنچمارک جامع «INS-ActBench» را معرفی کردهاند که به طور خاص برای سنجش توانمندیهای مدلهای زبانی (LLM) در حوزه تخصصی بیمه و اکچوئری طراحی شده است.
این بنچمارک با داشتن بیش از ۱۲ هزار سوال استاندارد، ابزارهای کدنویسی و تحلیل پرونده، به ما کمک میکند تا بفهمیم مدلهای هوش مصنوعی تا چه حد در تصمیمگیریهای پیچیده مالی و بیمهای قابل اعتماد هستند. نتایج نشان میدهد که مدلهای فعلی در دانش تئوری عالی عمل میکنند، اما در اجرای وظایف عملیاتی و تحلیلهای موردی هنوز راه زیادی در پیش دارند.
منبع باز این پروژه برای توسعهدهندگان در دسترس است.
منبع: arXiv NLP
