⚠️ وقتی بنچمارک‌ها فریبمان می‌دهند: چالش بزرگ در امنیت LLMها

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جدید، نکته بسیار مهمی را در مورد امنیت مدل‌های زبانی (LLM) فاش کرده‌اند: سیستم‌های فعلی برای ارزیابی «حملات تزریق پرامپت» و «فرار از زندان» (Jailbreak) دقیق نیستند و خوش‌بینی کاذبی ایجاد می‌کنند!

🔹 مشکل اصلی کجاست؟
بیشتر ابزارهای شناسایی حملات، روی داده‌های خاصی آموزش می‌بینند که باعث می‌شود به جای درک ماهیت حمله، صرفاً «الگوهای ظاهری» داده‌ها را حفظ کنند (Shortcut). این یعنی مدل در محیط واقعی که داده‌ها متفاوت است، عملکرد بسیار ضعیف‌تری خواهد داشت.

🔹 راهکار ارائه شده:
تیم پژوهشی از روشی به نام LODO استفاده کرده که در آن مدل باید روی داده‌هایی تست شود که قبلاً هرگز ندیده است. نتایج نشان می‌دهد که دقت تشخیص حملات در شرایط واقعی می‌تواند تا ۲۵ درصد کمتر از آن چیزی باشد که تا امروز تصور می‌کردیم.

این تحقیق هشدار می‌دهد که برای امنیت ایجنت‌های هوشمند آینده، باید در روش‌های ارزیابی خود بازنگری جدی داشته باشیم.

🔗 لینک پروژه: https://github.com/maxf-zn/prompt-mining

منبع: arXiv Machine Learning