تا حالا فکر کردید چطور امنیت مدلهای زبانی را در برابر «جیلبریک» (Jailbreak) یا همان حملات دور زدن محدودیتها بسنجیم؟ مشکل اینجاست که تکنیکهای حمله سریعتر از بنچمارکها رشد میکنند و مقایسهشان با هم تقریباً غیرممکن شده است.
محققان با معرفی سیستم جدید Jailbreak Foundry (JBF)، راهکار جذابی ارائه دادند:
✅ ترجمه خودکار: این سیستم با استفاده از عاملهای هوشمند، مقالاتِ علمی درباره حملات را به کدهای قابل اجرا تبدیل میکند.
✅ استانداردسازی: با ایجاد یک محیط یکپارچه، امکان تست ۳۰ نوع حمله مختلف روی ۱۰ مدل بزرگ زبانی را فراهم کرده است.
✅ کاهش هزینهها: با اشتراکگذاری زیرساختها، میزان کدنویسی لازم برای اجرای هر حمله تا ۵۰٪ کاهش یافته است.
این یعنی از این به بعد، محققان امنیتی خیلی سریعتر میتوانند مدلهای هوش مصنوعی را در برابر سوءاستفادهها بیمه کنند و یک «بنچمارک زنده» برای امنیت داشته باشیم. 🚀
منبع: arXiv AI
