تا به حال فکر کردهاید که آیا حملات «Jailbreak» که هدفشان دور زدن محدودیتهای مدلهای زبانی است، واقعاً برای امنیت مفید هستند؟
محققان در مقاله جدید خود، دیدگاه «مدافعمحور» را مطرح کردهاند. بهجای تمرکز صرف بر نرخ موفقیت حمله (ASR)، آنها چارچوب جدیدی به نام A-MESS را معرفی کردهاند که به ما میگوید کدام حملات واقعاً برای آموزش ایمنتر مدلها ارزش دارند.
نکته جالب اینجاست: بسیاری از حملاتی که مدل را «میشکنند»، لزوماً در بهبود امنیت آن موثر نیستند! با استفاده از امتیازدهی هوشمندانه Shapley، حالا میتوانیم مجموعهای از حملات را انتخاب کنیم که در عمل باعث بهبود واقعی امنیت مدلها میشوند.
این یعنی در آینده نه چندان دور، حملات «جیلبریک» به جای ابزاری برای خرابکاری، به منابعی ارزشمند برای ساخت هوش مصنوعی ایمنتر تبدیل خواهند شد. 💡
منبع: arXiv NLP
