محققان به تازگی بنچمارک جامع و جدیدی به نام MyoCardBench معرفی کردهاند که به طور اختصاصی برای ارزیابی عملکرد مدلهای زبانی (LLM) در حوزه تخصصی بیماریهای قلبی طراحی شده است.
چرا این خبر مهم است؟
بسیاری از بنچمارکهای فعلی پزشکی، فقط سوالات تئوری را بررسی میکنند، اما MyoCardBench فراتر رفته و با استفاده از بیش از ۲۲۰۰ داده واقعی و چالشهای کلینیکی (مثل شرایط اضطراری یا تفسیر نوار قلب)، عملکرد مدلها را در شرایط واقعی میسنجد.
نتایج جالب:
طبق این ارزیابی، مدلهایی مثل GPT-5.4 و Gemini 3.1 Pro پیشتاز هستند، اما همچنان در حوزههای حساسی مثل «اخلاق پزشکی» و «تفسیر نوار قلب» شاهد ضعفهای قابل توجهی در مدلهای فعلی هستیم. این نشان میدهد که برای اعتماد کامل به هوش مصنوعی در اتاق عمل و تشخیصهای قلبی، هنوز راه درازی در پیش است. 🩺💻
منبع: arXiv NLP
