بسیاری از سیستمهای امنیتی LLM، هر پیام را به صورت جداگانه بررسی میکنند که باعث میشود خطراتی که در طول یک گفتگوی طولانی ایجاد میشوند، نادیده گرفته شوند. محققان به تازگی فریمورک «CRA» را معرفی کردهاند که با ردیابی تغییرات معنایی و حساسیت در طول گفتگو، از تبدیل شدن پرسشهای بیخطر به خروجیهای مضر در چتهای طولانی جلوگیری میکند.
این نوآوری گام مهمی در جهت ساخت دستیارهای هوشمند ایمنتر و قابلاعتمادتر است. 🤖✨
منبع: arXiv NLP
