🚀 پایان توهم در مدل‌های چندوجهی! معرفی راهکار نوآورانه ASCD 🧠

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

یکی از بزرگترین چالش‌های مدل‌های چندوجهی (MLLM)، «توهم» یا تولید اطلاعات نادرست به دلیل تحلیل غلط تصاویر است. حالا محققان روشی جدید به نام ASCD را معرفی کرده‌اند که بدون نیاز به آموزش مجدد و با هزینه محاسباتی ناچیز، این مشکل را حل می‌کند!

💡 این روش چگونه کار می‌کند؟
ASCD با هدایت مستقیم «توجه» (Attention) مدل، همزمان دو کار انجام می‌دهد: تقویت بخش‌های متنی مطمئن و تضعیف توکن‌های تصویری که باعث گمراهی مدل می‌شوند.

نتایج فوق‌العاده است: کاهش چشمگیر توهم (تا ۳۸.۲٪) و افزایش دقت در آزمون‌های معتبری مثل MMMU و TextVQA. این یعنی قدمی بزرگ به سمت مدل‌های هوشمندتر و قابل‌اعتمادتر! ⚡

منبع: arXiv Computer Vision