مدلهای زبانی بزرگ (LLM) در آزمونهای پزشکی عملکرد فوقالعادهای دارند، اما آیا واقعاً برای استفاده در محیطهای درمانی آمادهاند؟ تحقیقات جدید نشان میدهد که معیارهای سنتی دیگر کافی نیستند!
محققان فریمورک جدیدی به نام MEDIC را معرفی کردهاند که فراتر از دانش عمومی، توانایی مدلها را در «اجرای وظایف عملی»، «دقت محاسبات بالینی» و «تشخیص توهمات (Hallucinations)» میسنجد. این ابزار به متخصصان کمک میکند تا قبل از استفاده از هوش مصنوعی در محیطهای حساس درمانی، از عملکرد واقعی و ایمنی آن اطمینان حاصل کنند. به نظر میرسد شکاف بزرگی بین «دانش تئوری» و «مهارت عملی» مدلها وجود دارد که باید برطرف شود. 🩺🤖
منبع: arXiv AI
