محققان در پژوهشی جدید، متد خطرناک و هوشمندانهای به نام LFJ (مخفف Latent Fusion Jailbreak) را معرفی کردهاند که میتواند دیوارههای امنیتی مدلهای زبانی بزرگ (LLMs) را دور بزند.
این روش با ترکیب «پرسشهای مخرب» با «محتوای بیخطر» در سطح لایههای پنهان مدل، باعث میشود هوش مصنوعی فیلترهای اخلاقی خود را فراموش کرده و پاسخهای ناامن تولید کند. نکته نگرانکننده اینجاست که این روش در آزمایشها به نرخ موفقیت چشمگیر ۹۴ درصدی دست یافته است! ⚠️
البته پژوهشگران برای مقابله با این تهدید، یک متد «آموزش تقابلی» (Adversarial Training) اختصاصی نیز طراحی کردهاند که میتواند نرخ موفقیت این حملات را تا حد زیادی کاهش دهد.
این تحقیق گامی مهم برای درک آسیبپذیریهای داخلی مدلها و بهبود امنیت آنهاست.
منبع: arXiv AI
