محققان به تازگی بنچمارک جدیدی به نام «PhysAssistBench» معرفی کردند که هدف آن ارزیابی دقیق توانایی مدلهای زبانی در همکاری با پزشکان است. برخلاف تستهای قبلی که فقط روی دانش بالینی یا چت متمرکز بودند، این مدل باید بتواند همزمان با پزشک تعامل کند، پروندههای الکترونیک بیمار (EHR) را تحلیل کرده و به سوالات مبهم بیمار پاسخ دهد.
نتایج اولیه نشان میدهد که حتی پیشرفتهترین مدلهای فعلی هم هنوز در هماهنگی بین دانش، ارتباط و ابزارهای سیستم در محیطهای واقعی درمانی با چالش جدی روبرو هستند. این قدمی بزرگ برای استانداردسازی هوش مصنوعی در پزشکی است! 🩺💻
منبع: arXiv AI
