ویرایش مدلهای بینایی-زبانی (VLM) در حوزه پزشکی بسیار حساس است؛ چون یک اشتباه کوچک میتواند نتایج تشخیصی را تغییر دهد. محققان به تازگی بنچمارک جدیدی به نام M3Bench معرفی کردهاند که به طور تخصصی برای ارزیابی «ویرایش ایمن» این مدلها طراحی شده است.
این بنچمارک با بیش از ۱۶ هزار سوال بالینی، بررسی میکند که آیا اصلاحات انجام شده روی مدلها، همچنان قابل اعتماد و دقیق باقی میمانند یا خیر. این دستاورد گامی بزرگ برای اطمینان از عملکرد مدلهای هوش مصنوعی در محیطهای واقعی درمانی است.
منبع: arXiv AI
