تحقیق جدیدی که بهتازگی منتشر شده، پرده از یک چالش مهم در دنیای LLMها برداشته است: روشهایی که ما برای تطبیق مدلها با وظایف خاص استفاده میکنیم (مثل Fine-tuning)، میتوانند بهطور ناخواسته روی «همسویی» (Alignment) و امنیت مدل اثر منفی بگذارند.
نکات کلیدی این پژوهش:
🔹 روشهای SFT (تنظیم دقیق) معمولاً باعث تغییرات ناخواسته و رانش (Drift) در رفتارهای ایمنی مدل میشوند.
🔹 استفاده از RLVR (یادگیری تقویتی با پاداشهای تاییدپذیر) عملکرد مدل را حفظ کرده و آسیب کمتری به همسویی وارد میکند.
🔹 اهمیتِ استفاده از روشهای تنظیم (مثل KL-regularization) برای جلوگیری از فراموشی دستورالعملهای ایمنی پیشفرض مدل، دوچندان است.
این مقاله ثابت میکند که آموزش تکمیلی فقط افزایش توانمندی نیست، بلکه یک «دخالت در همسویی» است که باید برای آن برنامهریزی دقیقتری داشت. 🧠⚙️
منبع: arXiv NLP
