یکی از چالشهای بزرگ در امنیت هوش مصنوعی، جلوگیری از «فرار از زندان» (Jailbreak) مدلها بدون کاهش کارایی آنها در وظایف اصلی است. محققان به تازگی روشی به نام COCA را معرفی کردهاند که با سادهسازی مرزهای تصمیمگیری در نمایشهای داخلی مدل (Representations)، امکان حذف مفاهیم مضر را بسیار دقیقتر میکند.
این متد جدید با تفکیک هوشمندانه مفاهیم ناامن از پاسخهای مفید، باعث میشود مدلها در برابر حملات خصمانه بسیار مقاومتر شوند و در عین حال توانایی خود را در انجام کارهای محاسباتی یا برنامهنویسی حفظ کنند. گامی مهم به سوی مدلهای زبانی ایمنتر و قابلاعتمادتر! 🚀
منبع: arXiv Machine Learning
