🤖 آیا «آموزش تکمیلی» مدل‌های زبانی، امنیت آن‌ها را به خطر می‌اندازد؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تحقیق جدیدی که به‌تازگی منتشر شده، پرده از یک چالش مهم در دنیای LLMها برداشته است: روش‌هایی که ما برای تطبیق مدل‌ها با وظایف خاص استفاده می‌کنیم (مثل Fine-tuning)، می‌توانند به‌طور ناخواسته روی «هم‌سویی» (Alignment) و امنیت مدل اثر منفی بگذارند.

نکات کلیدی این پژوهش:
🔹 روش‌های SFT (تنظیم دقیق) معمولاً باعث تغییرات ناخواسته و رانش (Drift) در رفتارهای ایمنی مدل می‌شوند.
🔹 استفاده از RLVR (یادگیری تقویتی با پاداش‌های تاییدپذیر) عملکرد مدل را حفظ کرده و آسیب کمتری به هم‌سویی وارد می‌کند.
🔹 اهمیتِ استفاده از روش‌های تنظیم (مثل KL-regularization) برای جلوگیری از فراموشی دستورالعمل‌های ایمنی پیش‌فرض مدل، دوچندان است.

این مقاله ثابت می‌کند که آموزش تکمیلی فقط افزایش توانمندی نیست، بلکه یک «دخالت در هم‌سویی» است که باید برای آن برنامه‌ریزی دقیق‌تری داشت. 🧠⚙️

منبع: arXiv NLP