یکی از بزرگترین چالشهای مدلهای زبانی چندوجهی (Multimodal LLMs)، مشکل «توهم» (Hallucination) است؛ جایی که مدل اطلاعات بصری را اشتباه تفسیر میکند. محققان به تازگی روشی به نام DICA را معرفی کردهاند که مانند یک «ناظر هوشمند» عمل میکند.
این مدل با ردیابی دو شاخص کلیدی یعنی «تمرکز توجه بصری» و «وابستگی خروجی به تصویر»، به محض تشخیص انحراف در استدلال، مداخله کرده و دقت پاسخ را به شدت افزایش میدهد. با این تکنیک، مدلها هنگام تحلیل تصاویر، کمتر دچار سردرگمی میشوند.
اگر در حوزه توسعه مدلهای بینایی-زبانی فعالیت میکنید، میتوانید جزئیات این دستاورد و کدهای آن را در گیتهاب بررسی کنید.
🔗 لینک پروژه: https://github.com/BGWH123/DICA/
منبع: arXiv AI
