محققان در مطالعه اخیر خود، پدیده جالبی به نام «مقاومت درونی در برابر هدایت» (ESR) را در مدلهای زبانی کشف کردهاند. این یعنی مدلهای قدرتمندی مثل Llama-3.3-70B گاهی میتوانند در میانه تولید متن، متوجه انحراف از مسیرِ تعیینشده توسط کاربر (Activation Steering) شوند و خودشان را اصلاح کنند! 🧠
این یافته به دو دلیل بسیار مهم است:
۱. میتواند راهکاری برای جلوگیری از دستکاریهای مخرب و نفوذ به مدلها باشد.
۲. ممکن است کارِ متخصصانی که میخواهند با روشهای هدایتِ فعال (Steering) مدلها را بهینه کنند، سختتر کند.
به نظر شما، آیا این خوداصلاحی مدلها به امنیت بیشتر منجر میشود یا راه کنترل ما بر AI را دشوارتر میکند؟
منبع: arXiv AI
