محققان به یافته عجیبی در مورد مدلهای زبانی ویدئویی (Video LLMs) دست پیدا کردهاند: این مدلها وقتی با ویدئوهای مخرب اما پرسشهای بهظاهر «بیخطر» روبرو میشوند، راحتتر فریب میخورند!
🔹 چالش چیست؟
برخلاف تصور، مدلهای فعلی محتوای مخرب ویدئویی را با دقت بالای ۸۱ درصد شناسایی میکنند، اما نرخ موفقیت حملات وقتی با دستورات ساده ترکیب میشوند، همچنان نزدیک به ۵۰ درصد است!
🔹 راهکار V-DEAL:
پژوهشگران چارچوبی به نام V-DEAL معرفی کردهاند که به صورت ریشهای بررسی میکند چرا مدلها دچار این «شکاف درک و امتناع» میشوند. آنها همچنین یک روش جدید برای تزریق پرامپت (Prompt Injection) طراحی کردهاند که میتواند نرخ این حملات را تا ۴۸ درصد کاهش دهد و امنیت مدلهای ویدئویی را به شکل چشمگیری افزایش دهد.
این تحقیق گام مهمی برای ایمنتر کردن هوش مصنوعی در دنیای پر از ویدئوی امروز است. 🛡️
منبع: arXiv AI
