محققان در پژوهشی جدید، چارچوب نوآورانهای به نام «Multimodal Cross-Attention Fusion» معرفی کردهاند که میتواند با دقت خیرهکنندهای، مفهوم و نیت پشت میمهای اینترنتی (بهویژه در زبانهای کممنابع مانند بنگالی) را تحلیل کند. این مدل با ترکیب پیشرفته بینایی ماشین (برای خواندن متنهای روی تصویر) و توجه متقاطع (Cross-Attention)، ارتباط معنایی بین متن و عناصر بصری را به خوبی درک میکند.
این دستاورد که در تشخیص نیت سیاسی در میمها به دقت بسیار بالایی (Macro-F1 ≈ 0.94) رسیده، گام مهمی در جهت تحلیل بهتر دادههای شبکههای اجتماعی و فهم تعاملات پیچیده تصویر و متن است. 🚀
منبع: arXiv Computer Vision
