🏥 ارزیابی هوش مصنوعی در تشخیص‌های پزشکی: معرفی ClinMM-Bench

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله‌ای جدید به سراغ سنجش واقعی مدل‌های هوش مصنوعی (MLLMs) در دنیای پزشکی رفتند. چالش اصلی این است که تشخیص بیماری در واقعیت یک فرآیند مرحله‌به‌مرحله است، نه یک سوال و جواب ساده!

برنامه جدید ClinMM-Bench با بیش از ۱۰۰۰ کیس بالینی و ۳۷۰۰ تصویر پزشکی، ۱۵ مدل بزرگ هوش مصنوعی را به چالش کشیده است. نتایج نشان می‌دهد که اگرچه مدل‌های قدرتمند فعلی در حدس زدن تشخیص‌ها خوب عمل می‌کنند، اما در «استدلال منطقی» و ترکیب دقیق داده‌های چندرسانه‌ای برای رسیدن به تشخیص نهایی، هنوز ضعف‌های جدی دارند.

این تحقیق گامی مهم برای ایمن‌تر کردن هوش مصنوعی در محیط‌های بیمارستانی است. 🩺💻

منبع: arXiv AI