🛡️ راهکاری نو برای افزایش امنیت LLMها: معرفی TRACE

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از چالش‌های بزرگ در سفارشی‌سازی مدل‌های زبانی (Fine-Tuning)، از بین رفتن فیلترهای ایمنی مدل است. وقتی مدل‌ها را برای کارهای خاص شخصی‌سازی می‌کنیم، ممکن است ناخواسته رفتارهای ناامن در آن‌ها دوباره ظاهر شود.

محققان در مقاله جدیدی، چارچوب هوشمندانه TRACE را معرفی کرده‌اند. این روش به جای تغییرات پیچیده آنلاین، با استفاده از «آموزش پَچ‌های ایمنی» (Safety Patch Learning) به صورت آفلاین، امنیت مدل را بدون آسیب زدن به کارایی و عملکردِ شخصی‌سازی‌شده‌اش، بازیابی می‌کند.

این یعنی می‌توانیم مدل‌هایی داشته باشیم که هم دقیقاً همان‌طور که می‌خواهیم کار می‌کنند و هم همچنان اصول ایمنی را رعایت می‌کنند! 🚀

منبع: arXiv AI