🔓 رخنه در امنیت هوش مصنوعی؛ حمله جدید Latent Fusion Jailbreak چیست؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهشی جدید، متد خطرناک و هوشمندانه‌ای به نام LFJ (مخفف Latent Fusion Jailbreak) را معرفی کرده‌اند که می‌تواند دیواره‌های امنیتی مدل‌های زبانی بزرگ (LLMs) را دور بزند.

این روش با ترکیب «پرسش‌های مخرب» با «محتوای بی‌خطر» در سطح لایه‌های پنهان مدل، باعث می‌شود هوش مصنوعی فیلترهای اخلاقی خود را فراموش کرده و پاسخ‌های ناامن تولید کند. نکته نگران‌کننده اینجاست که این روش در آزمایش‌ها به نرخ موفقیت چشمگیر ۹۴ درصدی دست یافته است! ⚠️

البته پژوهشگران برای مقابله با این تهدید، یک متد «آموزش تقابلی» (Adversarial Training) اختصاصی نیز طراحی کرده‌اند که می‌تواند نرخ موفقیت این حملات را تا حد زیادی کاهش دهد.

این تحقیق گامی مهم برای درک آسیب‌پذیری‌های داخلی مدل‌ها و بهبود امنیت آن‌هاست.

منبع: arXiv AI