محققان در مقالهای جدید به سراغ سنجش واقعی مدلهای هوش مصنوعی (MLLMs) در دنیای پزشکی رفتند. چالش اصلی این است که تشخیص بیماری در واقعیت یک فرآیند مرحلهبهمرحله است، نه یک سوال و جواب ساده!
برنامه جدید ClinMM-Bench با بیش از ۱۰۰۰ کیس بالینی و ۳۷۰۰ تصویر پزشکی، ۱۵ مدل بزرگ هوش مصنوعی را به چالش کشیده است. نتایج نشان میدهد که اگرچه مدلهای قدرتمند فعلی در حدس زدن تشخیصها خوب عمل میکنند، اما در «استدلال منطقی» و ترکیب دقیق دادههای چندرسانهای برای رسیدن به تشخیص نهایی، هنوز ضعفهای جدی دارند.
این تحقیق گامی مهم برای ایمنتر کردن هوش مصنوعی در محیطهای بیمارستانی است. 🩺💻
منبع: arXiv AI
