محققان به تازگی علت اصلی «توهم» (Hallucination) در مدلهای زبانی-تصویری (MLLMs) را کشف کردند. آنها متوجه شدند که مدلها هنگام تحلیل تصاویر، دچار «حواسپرتی» مشابه انسان میشوند که باعث کاهش دقت در توصیف جزئیات میگردد.
راهکار جدید آنها یعنی AFIP، بدون نیاز به آموزش مجدد و با تقویت توجه متقاطع (Cross-head attention)، باعث بهبود چشمگیر درک بصری مدل و کاهش خطاهای توصیفی میشود. این یعنی هوش مصنوعی در آینده، تصاویر را بسیار دقیقتر و واقعیتر درک خواهد کرد. 🧠✨
برای دسترسی به کد و جزئیات بیشتر به لینک زیر مراجعه کنید:
https://github.com/MIKUZ12/AFIP
منبع: arXiv Computer Vision
