محققان در پژوهشی تازه، نوع جدیدی از آسیبپذیری در مدلهای زبانی بزرگ (LLM) را کشف کردهاند که آن را «Incomplete Prompt Jailbreak» یا IPJ نامیدهاند. در این روش، مدلها با دریافت جملات ناقص، فریب خورده و محتوای مضر تولید میکنند.
نکته جالب اینجاست که مدلها معمولاً تا پایان جمله صبر میکنند و فقط در انتها متوجه نیت پلید پرامپت میشوند. محققان برای مقابله با این مشکل، دو نوع «نورون» خاص (نورونهای پایاندهنده و ادامهدهنده) را شناسایی کردهاند که میتوان با کنترل آنها، امنیت مدلها را در برابر این حملات ارتقا داد. این یافته راهکاری دقیقتر از آموزشهای سنتی برای افزایش امنیت هوش مصنوعی ارائه میدهد. 🤖💡
منبع: arXiv AI
