🛡️ راهکار جدید برای افزایش امنیت مدل‌های زبانی بدون نیاز به آموزش مجدد! 🚀

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان روشی نوآورانه به نام «DAPA» معرفی کرده‌اند که به مدل‌های زبانی بزرگ اجازه می‌دهد بدون نیاز به فرآیندهای سنگینِ آموزش (Fine-tuning) یا یادگیری تقویتی (RLHF)، امنیت خود را در برابر پاسخ‌های مضر حفظ کنند.

این متد که از نوع «Plug-and-Play» است، با استفاده از تقطیر دانش (Knowledge Distillation) از مدل‌های ایمن، رفتارهای امن را به مدل‌های دیگر تزریق می‌کند. در تست‌های انجام شده، این روش توانسته موفقیت در جلوگیری از تولید محتوای مضر را تا حدود ۱۴ درصد افزایش دهد، بدون اینکه عملکرد اصلی مدل کاهش پیدا کند! 🧠✨

منبع: arXiv NLP