🚀 پایان توهمات بصری در مدل‌های چندوجهی با روش جدید AFIP!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به تازگی علت اصلی «توهم» (Hallucination) در مدل‌های زبانی-تصویری (MLLMs) را کشف کردند. آن‌ها متوجه شدند که مدل‌ها هنگام تحلیل تصاویر، دچار «حواس‌پرتی» مشابه انسان می‌شوند که باعث کاهش دقت در توصیف جزئیات می‌گردد.

راهکار جدید آن‌ها یعنی AFIP، بدون نیاز به آموزش مجدد و با تقویت توجه متقاطع (Cross-head attention)، باعث بهبود چشمگیر درک بصری مدل و کاهش خطاهای توصیفی می‌شود. این یعنی هوش مصنوعی در آینده، تصاویر را بسیار دقیق‌تر و واقعی‌تر درک خواهد کرد. 🧠✨

برای دسترسی به کد و جزئیات بیشتر به لینک زیر مراجعه کنید:
https://github.com/MIKUZ12/AFIP

منبع: arXiv Computer Vision