تا به حال به این فکر کردهاید که چطور مدلهای هوش مصنوعی را برای تحلیل عکسهای رادیولوژی (X-ray) تست میکنند؟ یک پژوهش جدید نشان میدهد که روشهای سنتی ارزیابی، ممکن است تصویر درستی از «کارآمدی بالینی» این مدلها به ما ندهند.
محققان با بررسی مدلهای مختلف هوش مصنوعی متوجه شدند که انتخابِ منبعِ برچسبگذاری (اینکه مدل با چه معیاری آموزش دیده و ارزیابی شده)، میتواند نتایج و رتبهبندی مدلها را به کلی تغییر دهد. نتیجه اینکه: بسیاری از معیارهای محبوب فعلی، در دنیای واقعیِ تشخیص بیماری، دقت لازم را ندارند!
این تحقیق هشدار میدهد که برای اعتماد به هوش مصنوعی در حوزه سلامت، باید معیارهای ارزیابی را به استانداردهای پزشکان متخصص نزدیکتر کنیم. 🩺🤖
منبع: arXiv Computer Vision
