مدلهای بزرگ بینایی-زبانی (LVLMs) با وجود قدرت بالا، گاهی دچار توهم میشوند و چیزهایی را میبینند که در تصویر وجود ندارد. خبر خوب اینکه محققان روش جدیدی به نام CAST ارائه دادهاند که بدون نیاز به آموزش سنگین یا هزینههای اضافی، این مشکل را حل میکند!
این روش با هدایت توجه مدل به سمت «زیرنویسهای دقیق»، دقت بصری را به شدت بالا میبرد و خطای توهم را بهطور میانگین تا ۶ درصد کاهش میدهد. نکته جذاب اینجاست که CAST یک ابزار «Plug-and-Play» است و بدون کند کردن سرعت پردازش، به مدلهای فعلی اضافه میشود.
منبع: arXiv Computer Vision
