محققان در یک دستاورد تازه، بنچمارک جدیدی به نام MIRA-Ev معرفی کردهاند که تحولی در نحوه ارزیابی مدلهای زبانی در حوزه بالینی ایجاد میکند. مشکل اصلی مدلهای فعلی (MCQA) این است که فقط پاسخ نهایی را چک میکنند، اما MIRA-Ev بررسی میکند که آیا مدل واقعاً بر اساس شواهد علمی درست به نتیجه رسیده یا صرفاً حدس زده است!
این بنچمارک که شامل دادههای آزمونهای پزشکی به زبانهای اسپانیایی، انگلیسی و باسکی است، در سه سطح «استخراج شواهد»، «استخراج استدلال» و «طبقهبندی روابط» مدلها را به چالش میکشد. گامی مهم برای افزایش دقت و اعتماد در تشخیصهای پزشکی توسط هوش مصنوعی. 🩺🤖
منبع: arXiv AI
