🔍 پایانِ «توهماتِ ارجاعی» در مدل‌های بینایی-زبانی! 📄

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک پژوهش جدید، راهکار هوشمندانه‌ای برای درک دقیق‌تر اسناد بصری (Visual Document Understanding) ارائه کرده‌اند.

مشکل اصلی مدل‌های فعلی این بود که برای استناد به شواهد در یک فایل، از مختصات (Bounding Boxes) استفاده می‌کردند که اغلب باعث بروز «توهم ارجاعی» (Attribution Hallucination) می‌شد. حالا با جایگزینی این روش با یک «رابط زبانی» (که در آن مدل فقط متنِ سند را نقل‌قول می‌کند)، دقتِ شناسایی شواهد به‌طور چشمگیری افزایش یافته و نرخ خطای توهم مدل تا نصف کاهش پیدا کرده است! 🚀

این تحقیق نشان می‌دهد که گاهی ساده‌تر کردن رابطِ تعامل مدل با داده‌ها، می‌تواند خروجی‌های بسیار دقیق‌تر و منطقی‌تری به همراه داشته باشد.

منبع: arXiv Computer Vision