محققان در یک پژوهش جدید، نکته بسیار مهمی را در مورد امنیت مدلهای زبانی (LLM) فاش کردهاند: سیستمهای فعلی برای ارزیابی «حملات تزریق پرامپت» و «فرار از زندان» (Jailbreak) دقیق نیستند و خوشبینی کاذبی ایجاد میکنند!
🔹 مشکل اصلی کجاست؟
بیشتر ابزارهای شناسایی حملات، روی دادههای خاصی آموزش میبینند که باعث میشود به جای درک ماهیت حمله، صرفاً «الگوهای ظاهری» دادهها را حفظ کنند (Shortcut). این یعنی مدل در محیط واقعی که دادهها متفاوت است، عملکرد بسیار ضعیفتری خواهد داشت.
🔹 راهکار ارائه شده:
تیم پژوهشی از روشی به نام LODO استفاده کرده که در آن مدل باید روی دادههایی تست شود که قبلاً هرگز ندیده است. نتایج نشان میدهد که دقت تشخیص حملات در شرایط واقعی میتواند تا ۲۵ درصد کمتر از آن چیزی باشد که تا امروز تصور میکردیم.
این تحقیق هشدار میدهد که برای امنیت ایجنتهای هوشمند آینده، باید در روشهای ارزیابی خود بازنگری جدی داشته باشیم.
🔗 لینک پروژه: https://github.com/maxf-zn/prompt-mining
منبع: arXiv Machine Learning
