🏥 آزمون جدید برای سنجش هوش مصنوعی در محیط‌های درمانی!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به‌تازگی بنچمارک جدیدی به نام «MedLoCoMo» را معرفی کرده‌اند که به طور تخصصی توانایی مدل‌های زبانی بزرگ (LLM) را در درک تاریخچه طولانی‌مدت پرونده‌های پزشکی بیماران می‌سنجد.

در دنیای واقعی پزشکی، یک بیمار ممکن است چندین بار مراجعه و بستری داشته باشد. برخلاف مدل‌های قبلی که فقط روی یک برگه یا یک مکالمه کوتاه تمرکز داشتند، این ابزار بررسی می‌کند که آیا هوش مصنوعی می‌تواند اطلاعات پراکنده در ده‌ها جلسه درمانی را به هم متصل کند و تشخیص‌های دقیق‌تری ارائه دهد یا خیر.

نتایج نشان می‌دهد که تحلیل هوشمند در این سناریوهای پیچیده همچنان یک چالش بزرگ برای مدل‌های فعلی است. این دستاورد گامی مهم برای دستیابی به دستیاران پزشک هوشمندتر و قابل‌اعتمادتر در آینده است. 🩺✨

منبع: arXiv AI