🛡 آسیب‌پذیری جدید در مدل‌های زبانی: «فرار از زندان» با پرامپت‌های ناقص!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی تازه، نوع جدیدی از آسیب‌پذیری در مدل‌های زبانی بزرگ (LLM) را کشف کرده‌اند که آن را «Incomplete Prompt Jailbreak» یا IPJ نامیده‌اند. در این روش، مدل‌ها با دریافت جملات ناقص، فریب خورده و محتوای مضر تولید می‌کنند.

نکته جالب اینجاست که مدل‌ها معمولاً تا پایان جمله صبر می‌کنند و فقط در انتها متوجه نیت پلید پرامپت می‌شوند. محققان برای مقابله با این مشکل، دو نوع «نورون» خاص (نورون‌های پایان‌دهنده و ادامه‌دهنده) را شناسایی کرده‌اند که می‌توان با کنترل آن‌ها، امنیت مدل‌ها را در برابر این حملات ارتقا داد. این یافته راهکاری دقیق‌تر از آموزش‌های سنتی برای افزایش امنیت هوش مصنوعی ارائه می‌دهد. 🤖💡

منبع: arXiv AI