نتایج یک پژوهش جدید نشان میدهد که همیشه پیشرفتهترین مدلهای هوش مصنوعی (LLMs) بهترین عملکرد را در امور حساس پزشکی ندارند! محققان با بررسی مدلهایی مثل GPT-5.4 و DeepSeek-V4 در نوشتن گزارشهای بالینی (SOAP notes)، به نتایج جالبی رسیدند:
🔹 برخلاف انتظار، فعال کردن قابلیت «استدلال» (Reasoning) در برخی مدلها باعث افت کیفیت خروجی در مستندات پزشکی میشود.
🔹 مدلهای سادهتر یا بدون استدلالِ اضافه، گاهی خروجی دقیقتری برای ثبت اطلاعات بیماران ارائه میدهند.
🔹 این مطالعه تأکید میکند که قبل از بهکارگیری مدلهای جدید در حوزههای حساس پزشکی، باید حتماً ارزیابیهای اختصاصی انجام شود و نباید فقط به توانمندیهای کلی مدل تکیه کرد.
این یافته یادآوری مهمی است که در دنیای هوش مصنوعی، دقت و وفاداری به دادهها همیشه بر پیچیدگیهای محاسباتی ارجحیت دارد. نظر شما چیست؟ آیا به تشخیصهای AI در حوزه پزشکی اعتماد میکنید؟ 🤔
منبع: arXiv AI
