با ورود هوش مصنوعی به حوزههای بسیار حساس مثل پزشکی، حقوق و امور مالی، امنیت و دقتِ خروجیها بیش از هر زمان دیگری اهمیت پیدا کرده است. اخیراً بنچمارک جدیدی به نام «Trident-Bench» معرفی شده که عملکرد مدلهای زبانی (LLM) را بر اساس اصول اخلاقی و استانداردهای حرفهای در این سه حوزه ارزیابی میکند.
نکته جالب اینجاست که طبق این ارزیابی، حتی مدلهای قدرتمندی مثل GPT یا Gemini هم گاهی در درک ظرافتهای اخلاقی و تخصصی دچار چالش میشوند. این پژوهش گام بزرگی برای کاهش ریسک استفاده از AI در محیطهای کاری حساس است.
اطلاعات بیشتر و دسترسی به کد این بنچمارک در گیتهاب پروژه منتشر شده است. 🔍
منبع: arXiv Machine Learning
