محققان در پژوهشی تازه، پرده از سازوکار امنیتی مدلهای زبانی برداشتهاند. تا پیش از این فکر میکردیم مدلها برای رد درخواستهای مضر، از یک مسیر واحد استفاده میکنند، اما نتایج این تحقیق نشان میدهد که مفهوم «مضر بودن» (Harmfulness) و «امتناع از پاسخ» (Refusal) به صورت دو مفهوم کاملاً مجزا در مدل کدگذاری میشوند.
این دستاورد جذاب منجر به ابداع ابزار جدیدی به نام «Latent Guard» شده است؛ یک مکانیسم محافظتی درونی که نسبت به حملات جیلبریک بسیار مقاومتر از مدلهای فعلی است و میتواند دقت تشخیص محتوای ناامن را بدون آسیب زدن به کارایی مدل افزایش دهد. گامی مهم به سوی مدلهایی که واقعاً معنای امنیت را درک میکنند! 🛡️🤖
منبع: arXiv NLP
