محققان به تازگی روی ضعف بزرگی در مدلهای بینایی-زبانی (LVLM) تمرکز کردهاند: «حملات تایپوگرافی». در این نوع حملات، متنهای فریبندهای به تصاویر اضافه میشوند که مدل را در درک محتوا گمراه میکند.
نکته جالب اینجاست که اکثر مدلها فعلاً یا باید همه متنها را بخوانند یا کلاً نادیده بگیرند، اما در دنیای واقعی، هوش مصنوعی باید یاد بگیرد چه زمانی به متن روی تصاویر (مثل تابلوهای راهنمایی) توجه کند و چه زمانی فریب متون اضافه را نخورد!
بنچمارک جدیدی به نام RIO-Bench معرفی شده تا این توانایی «تشخیصِ هوشمندانه» را در مدلهای آینده تقویت کند. گامی مهم برای امنیت بیشتر در سیستمهای بینایی ماشین! 🛡
منبع: arXiv Computer Vision
