🛡️ آیا گارد‌های امنیتی هوش مصنوعی واقعاً نفوذناپذیرند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تحقیقات جدید در حوزه امنیت مدل‌های بصری-زبانی (VLM) نشان می‌دهد که «گارد‌های امنیتی» فعلی در برابر حملات فرار (Jailbreak) بسیار آسیب‌پذیر هستند.

محققان متوجه شدند که بسیاری از حملات با استفاده از روش‌هایی مثل کدنویسی، زبان‌های نادر یا منطق ریاضی، به راحتی از سد فیلترها عبور می‌کنند. راهکار پیشنهادی در این مقاله، استفاده از یک لایه «تقویت‌کننده» (Amplifier) است که متن‌های مبهم را قبل از بررسی توسط گارد، به زبان ساده بازنویسی می‌کند. با این حال، نتایج نشان می‌دهد که حتی با این روش هم شکاف امنیتی همچنان بزرگ است و مسیر طولانی برای رسیدن به یک دفاع واقعاً امن در پیش داریم.

این تحقیق نشان می‌دهد که دنیای امنیت در AI همچنان پر از چالش‌های حل‌نشده است!

منبع: arXiv AI