محققان ابزار جدیدی به نام SHOVIR معرفی کردند که یک چالش اساسی در مدلهای بینایی-زبانی (VLM) در گزارشنویسی رادیولوژی را هدف قرار میدهد. مشکل اینجاست که بسیاری از این مدلها به جای «دیدن» واقعیِ ضایعات در عکسهای رادیولوژی، از الگوهای کاذب یا «میانبرهای بینایی» (Shortcuts) استفاده میکنند تا پاسخهای درستی بدهند!
این بنچمارک جدید با ایجاد اختلالات منطقهای در عکسهای اشعه ایکس، بررسی میکند که آیا هوش مصنوعی واقعاً بر اساس شواهد تصویری تشخیص میدهد یا فقط حدس میزند. نتایج نشان میدهد که مدلهای برتر در دقت گزارشنویسی، لزوماً در «درک فضایی» و استدلال پزشکی دقیق نیستند. قدمی مهم برای افزایش اعتماد به هوش مصنوعی در حوزه سلامت! 🏥✨
منبع: arXiv NLP
