محققان در یک پژوهش جدید، راهکار هوشمندانهای برای درک دقیقتر اسناد بصری (Visual Document Understanding) ارائه کردهاند.
مشکل اصلی مدلهای فعلی این بود که برای استناد به شواهد در یک فایل، از مختصات (Bounding Boxes) استفاده میکردند که اغلب باعث بروز «توهم ارجاعی» (Attribution Hallucination) میشد. حالا با جایگزینی این روش با یک «رابط زبانی» (که در آن مدل فقط متنِ سند را نقلقول میکند)، دقتِ شناسایی شواهد بهطور چشمگیری افزایش یافته و نرخ خطای توهم مدل تا نصف کاهش پیدا کرده است! 🚀
این تحقیق نشان میدهد که گاهی سادهتر کردن رابطِ تعامل مدل با دادهها، میتواند خروجیهای بسیار دقیقتر و منطقیتری به همراه داشته باشد.
منبع: arXiv Computer Vision
