محققان در مطالعهای جدید به چالش بزرگی در مدلهای زبانی-تصویری (VLM) حوزه پزشکی پی بردهاند: بسیاری از این مدلها به جای تحلیل واقعی تصاویر، بر اساس الگوهای متنی «میانبر» میزنند!
برای حل این مشکل، مدل جدیدی به نام CORAL معرفی شده که با استفاده از تکنیکهای آموزشی خاص، توانایی مدل را برای «دیدن» و تحلیل دقیق شواهد بصری تقویت میکند. نتایج نشان میدهد که این مدل، توهمات بینایی (Visual Hallucination) را تا حد زیادی کاهش داده و دقت تشخیصی را به طرز چشمگیری بالا برده است. قدمی بزرگ برای اعتماد بیشتر به هوش مصنوعی در تشخیصهای حساس پزشکی! 🩺✨
منبع: arXiv Computer Vision
