آیا تا به حال دقت کردید که مدلهای بینایی-زبانی مثل CLIP در درک جملات منفی (مثل «سگی وجود ندارد») ضعف دارند؟ محققان در یک پژوهش جدید متوجه شدند که این مدلها در لایههای نهایی خود، ساختار نحوی جملات را قربانیِ تطبیق بصری میکنند.
راهکار جدید: «PeakPatch»!
بدون نیاز به آموزش مجدد (Fine-tuning) مدل سنگین CLIP، محققان یک لایه جانبی و سبک طراحی کردهاند که مستقیماً از لایههای میانیِ مدل که هنوز معنای نحوی را حفظ کردهاند، سیگنال «نفی» را استخراج میکند. نتیجه؟ بهبود خیرهکننده در دقت پاسخگویی به سوالات چندگزینهای (MCQ) بدون دست زدن به وزنهای اصلی مدل! 🚀
این یعنی هوش مصنوعی در درک ظرافتهای زبانی، یک گام دیگر به انسان نزدیکتر شد. 👌
منبع: arXiv Computer Vision
