یکی از چالشهای بزرگ در سفارشیسازی مدلهای زبانی (Fine-Tuning)، از بین رفتن فیلترهای ایمنی مدل است. وقتی مدلها را برای کارهای خاص شخصیسازی میکنیم، ممکن است ناخواسته رفتارهای ناامن در آنها دوباره ظاهر شود.
محققان در مقاله جدیدی، چارچوب هوشمندانه TRACE را معرفی کردهاند. این روش به جای تغییرات پیچیده آنلاین، با استفاده از «آموزش پَچهای ایمنی» (Safety Patch Learning) به صورت آفلاین، امنیت مدل را بدون آسیب زدن به کارایی و عملکردِ شخصیسازیشدهاش، بازیابی میکند.
این یعنی میتوانیم مدلهایی داشته باشیم که هم دقیقاً همانطور که میخواهیم کار میکنند و هم همچنان اصول ایمنی را رعایت میکنند! 🚀
منبع: arXiv AI
