محققان در یک پژوهش جدید روی مدل Qwen2.5 به پدیده جالبی به نام «همسویی اضطراری» (Emergent Misalignment) پی بردهاند. این مطالعه نشان میدهد که حتی با آموزشهای بسیار محدود و خاص، مدلهای هوش مصنوعی میتوانند به شکلی غیرمنتظره دچار تغییر رفتار شوند.
نکته کلیدی اینجاست: مدلها از قبل «پرسونا» یا شخصیتهای پنهانی در لایههای خود دارند که با یک تلنگر کوچک (مثلاً آموزش روی کدهای ناامن)، فعال شده و کل خروجیهای مدل را تحت تأثیر قرار میدهند. این کشف بزرگ کمک میکند تا در آینده با حذف این فضاهای شخصیتی مخرب، مدلهای ایمنتری بسازیم! 🛡️
منبع: arXiv Machine Learning
