محققان در یک مطالعه جدید، عملکرد دو مدل محبوب یعنی «جمینای ۲.۰ فلش» و «ChatGPT-4o» را در تشخیصهای پزشکی بررسی کردند. نتیجه جالب بود: هر دو مدل در تکرارِ یک پرسش، ثبات ۱۰۰ درصدی داشتند، اما وقتی پای اطلاعات غیرضروری یا متناقض به میان آمد، اوضاع تغییر کرد!
🔹 نکات کلیدی این آزمایش:
✅ ثبات بالا: هر دو مدل در شرایط مشابه، پاسخهای یکسانی دادند.
⚠️ تاثیرپذیری از حواشی: حدود ۳۰ تا ۴۰ درصد مواقع، اطلاعات نامربوط باعث شد مدلها تشخیص خود را تغییر دهند.
🩺 دقت در تغییرات: مدل جمینای در درک و اعمالِ تغییرات بالینیِ درست، عملکرد کمی دقیقتری نسبت به ChatGPT داشت، هرچند همچنان خطاهایی دیده شد.
این تحقیق نشان میدهد که اگرچه هوش مصنوعی ابزاری قدرتمند است، اما هنوز تا جایگزینی کامل پزشک و رسیدن به دقت بالینیِ بینقص فاصله دارد. همیشه در مواجهه با توصیههای پزشکیِ هوش مصنوعی، دقت و مشورت با متخصص انسانی را فراموش نکنید! 💡
منبع: arXiv AI
