🏥 ارتقای هوش مصنوعی در تشخیص‌های پزشکی با بنچمارک جدید MIRA-Ev

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک دستاورد تازه، بنچمارک جدیدی به نام MIRA-Ev معرفی کرده‌اند که تحولی در نحوه ارزیابی مدل‌های زبانی در حوزه بالینی ایجاد می‌کند. مشکل اصلی مدل‌های فعلی (MCQA) این است که فقط پاسخ نهایی را چک می‌کنند، اما MIRA-Ev بررسی می‌کند که آیا مدل واقعاً بر اساس شواهد علمی درست به نتیجه رسیده یا صرفاً حدس زده است!

این بنچمارک که شامل داده‌های آزمون‌های پزشکی به زبان‌های اسپانیایی، انگلیسی و باسکی است، در سه سطح «استخراج شواهد»، «استخراج استدلال» و «طبقه‌بندی روابط» مدل‌ها را به چالش می‌کشد. گامی مهم برای افزایش دقت و اعتماد در تشخیص‌های پزشکی توسط هوش مصنوعی. 🩺🤖

منبع: arXiv AI