مدلهای چندمنظوره بینایی-زبانی (LVLMs) با اینکه در تحلیل تصاویر عکاسی عالی هستند، اما وقتی پای تصاویر «سبکدار» (مثل آثار هنری، محیطهای بازی یا تصاویر پزشکی) به میان میآید، دچار توهم (Hallucination) شده و اطلاعات اشتباه میدهند.
محققان برای حل این مشکل، مکانیزم جدیدی به نام SAVER را معرفی کردهاند. این ابزار با بررسی لایههای اولیه شبکه و تطبیق هوشمندانه خروجیها، دقت مدل را در مواجهه با تصاویر گرافیکی و هنری به طرز چشمگیری افزایش میدهد. این دستاورد گام مهمی برای کاربردیتر کردن هوش مصنوعی در حوزههای تخصصی است. 🚀
منبع: arXiv Computer Vision
