🧠 وقتی هوش مصنوعی در «فهم نفی» به مشکل می‌خورد!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا حالا فکر کردید که مدل‌های بینایی-زبانی (VLM) چطور جملات منفی یا مفاهیم متضاد تصویری را درک می‌کنند؟ محققان در پژوهش جدیدی نشان دادند که این مدل‌ها در درک «نفی» (Negation) ضعف دارند؛ به طوری که مفهوم نفی در فضای نهفته (Latent Space) این مدل‌ها به خوبی تفکیک نمی‌شود.

تیم محققان با بررسی بیش از ۳۰۰۰ ویدیو، متوجه شدند که در حالی که نفی در متن مستقل است، اما در تصویر به شدت به بافت زبانی وابسته است. آن‌ها برای حل این چالش، یک معماری «توجه متقابل» (Cross-Modal Attention) پیشنهاد داده‌اند که دقت سیستم‌های چندوجهی را تا ۷ درصد افزایش می‌دهد! 🚀

این پیشرفت یعنی مدل‌های آینده در تحلیل ویدیوها بسیار هوشمندتر و دقیق‌تر عمل خواهند کرد.

منبع: arXiv AI