🚨 حفره امنیتی جدید در مدل‌های بینایی-زبانی (LVLM) با روش TokenSwap

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان متد جدیدی به نام «TokenSwap» را شناسایی کرده‌اند که می‌تواند مدل‌های پیشرفته بینایی-زبانی را با حملات «در پشتی» (Backdoor) هدف قرار دهد. برخلاف حملات قدیمی که الگوهای ثابت را تزریق می‌کردند، این روش بسیار زیرکانه‌تر عمل می‌کند!

🔹 تکنیک TokenSwap چگونه کار می‌کند؟
این حمله به جای تغییر محتوای خروجی، درک مدل از «روابط بین اشیاء» در تصویر را هدف می‌گیرد. در واقع مدل، اشیاء صحیح را شناسایی می‌کند اما در تحلیل رابطه بین آن‌ها (مثل جایگاه یا فعل آن‌ها) دچار خطا می‌شود. این یعنی مدل همچنان باهوش به نظر می‌رسد اما در منطقِ روابط شکست می‌خورد.

این تحقیق نشان می‌دهد که باید در آموزش مدل‌های چندوجهی (Multimodal) بیش از پیش مراقب امنیت داده‌های ورودی باشیم تا در دام چنین حملات پیچیده‌ای نیفتند.

منبع: arXiv Computer Vision