🧠 مقابله با «توهم» در مدل‌های چندوجهی؛ معرفی DICA

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

یکی از بزرگ‌ترین چالش‌های مدل‌های زبانی چندوجهی (Multimodal LLMs)، مشکل «توهم» (Hallucination) است؛ جایی که مدل اطلاعات بصری را اشتباه تفسیر می‌کند. محققان به تازگی روشی به نام DICA را معرفی کرده‌اند که مانند یک «ناظر هوشمند» عمل می‌کند.

این مدل با ردیابی دو شاخص کلیدی یعنی «تمرکز توجه بصری» و «وابستگی خروجی به تصویر»، به محض تشخیص انحراف در استدلال، مداخله کرده و دقت پاسخ را به شدت افزایش می‌دهد. با این تکنیک، مدل‌ها هنگام تحلیل تصاویر، کمتر دچار سردرگمی می‌شوند.

اگر در حوزه توسعه مدل‌های بینایی-زبانی فعالیت می‌کنید، می‌توانید جزئیات این دستاورد و کدهای آن را در گیت‌هاب بررسی کنید.

🔗 لینک پروژه: https://github.com/BGWH123/DICA/

منبع: arXiv AI