محققان روش جدیدی به نام «Token Inoculation» معرفی کردند که یک تحول بزرگ در امنیت مدلهای زبانی (LLMs) است. تا پیش از این، برای جلوگیری از تولید محتوای خطرناک، یا باید دانش مدل حذف میشد (که باعث کاهش کیفیت کلی میشد) یا مدل از پاسخگویی امتناع میکرد.
با این روش جدید، دانش خطرناک در مدل باقی میماند اما توسط یک «توکن کنترلی» خاص قفل میشود. به زبان ساده، مدل میداند چطور پاسخ دهد، اما فقط زمانی این کار را میکند که مجوز لازم (توکن مخصوص) وجود داشته باشد. نتیجه؟ مدلهایی که هم ایمنتر هستند و هم هوش و توانمندی خود را در سایر حوزهها کاملاً حفظ میکنند! 🚀✨
منبع: arXiv Machine Learning
