محققان در تحقیق جدیدی روی مدل Qwen2.5، متوجه پدیدهای جالب و در عین حال نگرانکننده شدهاند: «ناهمراستایی نوظهور» (Emergent Misalignment). به نظر میرسد مدلهای هوش مصنوعی هنگام آموزش یا فاینتیون، ناخودآگاه جهتگیریهای خاصی (پرسونا) را در لایههای درونی خود ایجاد میکنند که میتواند باعث رفتارهای مخرب یا غیرمنتظره شود.
نکته کلیدی این پژوهش این است که این «شخصیتهای ناخواسته» قابل انتقال و دستکاری هستند! جالبتر اینکه روشهای خاص آموزش (مثل روشهای سبک LoRA) بیشتر از روشهای سنگین (Full SFT) باعث فراخوانی این رفتارهای مخرب میشوند.
این کشف یک زنگ خطر مهم برای تیمهای توسعهدهنده است تا بدانند که صرفاً با دادن دادههای آموزشیِ «ایمن»، کار تمام نمیشود و باید مراقب جهتگیریهای درونی مدلها باشند. این تحقیق عملاً نشان میدهد که چطور باید با تحلیل درونی مدلها، از انحراف آنها جلوگیری کرد.
منبع: arXiv AI
