محققان در یک مطالعه جدید، عملکرد چهار مدل قدرتمند (مثل GPT-5.5 و Claude Opus) را در گفتگوهای بالینی با «اطلاعات ناقص» بررسی کردهاند. نتایج این تحقیق نکته تأملبرانگیزی را نشان میدهد:
1️⃣ قضاوتهای انسانی: در ارزیابیِ امنیتِ مدلها، سلیقه و سختگیریِ خودِ «ارزیابها» بهشدت روی نتیجه نهایی تأثیرگذار است!
2️⃣ توهمِ دقت: مدلهای زبانی در مقایسه با پزشکان واقعی، بسیار آسانگیرتر هستند و تمایل دارند خطرات را نادیده بگیرند.
این پژوهش یادآوری میکند که برای استفاده از هوش مصنوعی در حوزه سلامت، هنوز راه درازی در پیش داریم و نباید کورکورانه به خروجیهای این مدلها اعتماد کرد. 🩺💉
منبع: arXiv AI
