محققان تکنیک جدیدی به نام «Context Filtering» معرفی کردهاند که میتواند امنیت مدلهای زبانی (LLMs) را بهطور چشمگیری افزایش دهد.
این روش با فیلتر کردن ورودیهای مخرب و مشکوک، بدون اینکه از کیفیت و کارایی مدل برای کاربران عادی بکاهد، جلوی حملات «جیلبریک» (Jailbreak) را میگیرد. جالب اینجاست که این سیستم به عنوان یک راهکار «Plug-and-Play» روی تمام مدلهای هوش مصنوعی (چه متنباز و چه بسته) قابل اجراست و نرخ موفقیت حملات را تا ۹۲ درصد کاهش میدهد!
یک گام مهم دیگر برای امنتر کردن دنیای هوش مصنوعی. 🚀
منبع: arXiv AI
