محققان در مطالعهای جدید به بررسی نحوه عملکرد پرامپتهای «جیلبریک» (Jailbreak) و تأثیر تغییرات جزئی در آنها بر مدلهای بزرگی مثل Qwen و Llama پرداختهاند.
🔹 این تحقیق نشان میدهد که چگونه پرامپتهای بهظاهر ساده، با عبور از سدهای امنیتی، مدل را به پاسخهای غیرمجاز وادار میکنند. تحلیل فضای جاسازی (Embedding) این مدلها نشان داده که سیستمهای امنیتی فعلی در برابر حملات سطحِ رشتهای (string-level) همچنان آسیبپذیر هستند و خبری از یک «ابرساختار» یا دیوار دفاعی نفوذناپذیر در فضای برداری مدلها نیست.
این نوع پژوهشها گام مهمی برای درک نحوه تفکر مدلها و بستن حفرههای امنیتی است تا شاهد هوش مصنوعی ایمنتری باشیم.
منبع: arXiv AI
