تحقیقات جدید در حوزه امنیت مدلهای بصری-زبانی (VLM) نشان میدهد که «گاردهای امنیتی» فعلی در برابر حملات فرار (Jailbreak) بسیار آسیبپذیر هستند.
محققان متوجه شدند که بسیاری از حملات با استفاده از روشهایی مثل کدنویسی، زبانهای نادر یا منطق ریاضی، به راحتی از سد فیلترها عبور میکنند. راهکار پیشنهادی در این مقاله، استفاده از یک لایه «تقویتکننده» (Amplifier) است که متنهای مبهم را قبل از بررسی توسط گارد، به زبان ساده بازنویسی میکند. با این حال، نتایج نشان میدهد که حتی با این روش هم شکاف امنیتی همچنان بزرگ است و مسیر طولانی برای رسیدن به یک دفاع واقعاً امن در پیش داریم.
این تحقیق نشان میدهد که دنیای امنیت در AI همچنان پر از چالشهای حلنشده است!
منبع: arXiv AI
