تا حالا فکر کردید که مدلهای بینایی-زبانی (VLM) چطور جملات منفی یا مفاهیم متضاد تصویری را درک میکنند؟ محققان در پژوهش جدیدی نشان دادند که این مدلها در درک «نفی» (Negation) ضعف دارند؛ به طوری که مفهوم نفی در فضای نهفته (Latent Space) این مدلها به خوبی تفکیک نمیشود.
تیم محققان با بررسی بیش از ۳۰۰۰ ویدیو، متوجه شدند که در حالی که نفی در متن مستقل است، اما در تصویر به شدت به بافت زبانی وابسته است. آنها برای حل این چالش، یک معماری «توجه متقابل» (Cross-Modal Attention) پیشنهاد دادهاند که دقت سیستمهای چندوجهی را تا ۷ درصد افزایش میدهد! 🚀
این پیشرفت یعنی مدلهای آینده در تحلیل ویدیوها بسیار هوشمندتر و دقیقتر عمل خواهند کرد.
منبع: arXiv AI
