یکی از بزرگترین چالشهای مدلهای چندوجهی (MLLM)، «توهم» یا تولید اطلاعات نادرست به دلیل تحلیل غلط تصاویر است. حالا محققان روشی جدید به نام ASCD را معرفی کردهاند که بدون نیاز به آموزش مجدد و با هزینه محاسباتی ناچیز، این مشکل را حل میکند!
💡 این روش چگونه کار میکند؟
ASCD با هدایت مستقیم «توجه» (Attention) مدل، همزمان دو کار انجام میدهد: تقویت بخشهای متنی مطمئن و تضعیف توکنهای تصویری که باعث گمراهی مدل میشوند.
نتایج فوقالعاده است: کاهش چشمگیر توهم (تا ۳۸.۲٪) و افزایش دقت در آزمونهای معتبری مثل MMMU و TextVQA. این یعنی قدمی بزرگ به سمت مدلهای هوشمندتر و قابلاعتمادتر! ⚡
منبع: arXiv Computer Vision
