محققان در مقالهای جدید، متدولوژی پیشرفتهای به نام «AIM-CoT» را معرفی کردهاند که تحولی در نحوه استدلال مدلهای چندوجهی (Vision-Language Models) ایجاد میکند.
💡 این مدل جدید با استفاده از سه تکنیک نوآورانه:
۱. بهبود کیفیت توجه به متن (CAG)
۲. جستجوی فعال برای یافتن شواهد تصویری (AVP)
۳. محرکهای داینامیک برای تغییر توجه (DAT)
قادر است به شکلی بسیار دقیقتر، بخشهای مرتبط تصویر را با متن پرسش پیوند دهد تا پاسخهای هوشمندانهتر و منطقیتری ارائه کند.
اگر در زمینه طراحی و بهینهسازی مدلهای بینایی-زبانی فعالیت میکنید، این معماری جدید میتواند مسیر تازهای در حل مسائل استدلالی پیش روی شما بگذارد.
منبع: arXiv Computer Vision
