محققان در مقاله جدیدی به بررسی چرایی ضعف برخی مدلهای بینایی-زبانی (VLM) در استدلالهای مبتنی بر شواهد پرداختهاند. آنها متوجه شدند که این مدلها در لایههای میانی خود دارای یک «پنجره رله بصری» (VRW) هستند که نقش حیاتی در اتصال بینایی به متن ایفا میکند.
با معرفی چارچوب جدیدی به نام TRACE، محققان موفق شدند با کنترل دقیقتر روی این چرخه داخلی، دقت مدلها را در تحلیلهای دقیق بینایی تا ۶.۶ درصد افزایش دهند. این گام بزرگی برای هوش مصنوعی است تا هنگام «دیدن» اشیاء، کمتر دچار اشتباه شود! 🧠✨
منبع: arXiv AI
