آیا هوش مصنوعی میتواند به اندازه یک پزشک متخصص، تصمیمات اخلاقی در شرایط حساس بگیرد؟ محققان به تازگی چارچوب جدیدی به نام «PrinciplismQA» را معرفی کردهاند که به طور ویژه برای سنجش توانایی اخلاقی مدلهای زبانی (LLM) در حوزه پزشکی طراحی شده است.
برخلاف بنچمارکهای قبلی، این ابزار بر اساس اصول فلسفه اخلاق پزشکی بنا شده و شامل بیش از ۳۶۰۰ سوال تخصصی است. نتایج اولیه نشان میدهد که حتی مدلهای بسیار باهوش هم ممکن است در درک ظرافتهای اخلاقی دچار ضعف باشند. این پروژه گامی حیاتی برای اطمینان از ایمنی هوش مصنوعی پیش از ورود به محیطهای درمانی است.
برای جزئیات بیشتر و دسترسی به کدهای این تحقیق، میتوانید به صفحه گیتهاب پروژه مراجعه کنید. 🤖🏥
منبع: arXiv NLP



