محققان در اقدامی نوآورانه، بنچمارک جدیدی به نام «MedFailBench» را معرفی کردهاند که برخلاف روشهای سنتی، به جای سنجش دانش مدل، به سراغ شناسایی خطاهای ایمنی آن میرود.
این بنچمارک که توسط متخصصان بالینی طراحی شده، شکستهای هوش مصنوعی در محیطهای درمانی را دستهبندی کرده و سطوح خطر (از ۱ تا ۵) را برای مواردی مثل تشخیصهای اشتباه، دوز غیرایمن دارو یا جعل شواهد پزشکی تعیین میکند.
این ابزار گام بزرگی برای رسیدن به هوش مصنوعیِ قابلاعتمادتر در دنیای پزشکی است تا پزشکان و بیماران با اطمینان بیشتری به خروجیهای سیستمهای هوشمند تکیه کنند. 🩺🤖
منبع: arXiv NLP
