محققان در مطالعه جدیدی به بررسی یک حفره امنیتی جالب در مدلهای زبانی پرداختهاند. مشخص شده که اضافه کردن یک عبارت کوتاه مثل “Sure, here is” در ابتدای پرامپت (Prefill)، میتواند سدهای امنیتی هوش مصنوعی را به راحتی دور بزند!
این تحقیق نشان میدهد که سیستم «امتناع» (Refusal) در مدلها چندان عمیق نیست و بیشتر شبیه به یک واکنش سطحی در نیمه اول پاسخدهی است. با درک این مکانیزم، دانشمندان توانستند دقیقا نقطهای که مدل تصمیم به پاسخ دادن (یا ندادن) میگیرد را شناسایی کنند. این یافتهها گام مهمی برای ساخت مدلهای ایمنتر در برابر تکنیکهای Jailbreak است.
منبع: arXiv Machine Learning
