محققان روشی نوآورانه به نام «DAPA» معرفی کردهاند که به مدلهای زبانی بزرگ اجازه میدهد بدون نیاز به فرآیندهای سنگینِ آموزش (Fine-tuning) یا یادگیری تقویتی (RLHF)، امنیت خود را در برابر پاسخهای مضر حفظ کنند.
این متد که از نوع «Plug-and-Play» است، با استفاده از تقطیر دانش (Knowledge Distillation) از مدلهای ایمن، رفتارهای امن را به مدلهای دیگر تزریق میکند. در تستهای انجام شده، این روش توانسته موفقیت در جلوگیری از تولید محتوای مضر را تا حدود ۱۴ درصد افزایش دهد، بدون اینکه عملکرد اصلی مدل کاهش پیدا کند! 🧠✨
منبع: arXiv NLP
