🏥 هوش مصنوعی در اتاق عمل؛ آیا LLMها آماده دستیاری پزشکان هستند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به تازگی بنچمارک جدیدی به نام «PhysAssistBench» معرفی کردند که هدف آن ارزیابی دقیق توانایی مدل‌های زبانی در همکاری با پزشکان است. برخلاف تست‌های قبلی که فقط روی دانش بالینی یا چت متمرکز بودند، این مدل باید بتواند همزمان با پزشک تعامل کند، پرونده‌های الکترونیک بیمار (EHR) را تحلیل کرده و به سوالات مبهم بیمار پاسخ دهد.

نتایج اولیه نشان می‌دهد که حتی پیشرفته‌ترین مدل‌های فعلی هم هنوز در هماهنگی بین دانش، ارتباط و ابزارهای سیستم در محیط‌های واقعی درمانی با چالش جدی روبرو هستند. این قدمی بزرگ برای استانداردسازی هوش مصنوعی در پزشکی است! 🩺💻

منبع: arXiv AI