🛡️ مقاومت درونی مدل‌های زبانی: پدیده‌ای جدید در کنترل هوش مصنوعی

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه اخیر خود، پدیده جالبی به نام «مقاومت درونی در برابر هدایت» (ESR) را در مدل‌های زبانی کشف کرده‌اند. این یعنی مدل‌های قدرتمندی مثل Llama-3.3-70B گاهی می‌توانند در میانه تولید متن، متوجه انحراف از مسیرِ تعیین‌شده توسط کاربر (Activation Steering) شوند و خودشان را اصلاح کنند! 🧠

این یافته به دو دلیل بسیار مهم است:
۱. می‌تواند راهکاری برای جلوگیری از دستکاری‌های مخرب و نفوذ به مدل‌ها باشد.
۲. ممکن است کارِ متخصصانی که می‌خواهند با روش‌های هدایتِ فعال (Steering) مدل‌ها را بهینه کنند، سخت‌تر کند.

به نظر شما، آیا این خوداصلاحی مدل‌ها به امنیت بیشتر منجر می‌شود یا راه کنترل ما بر AI را دشوارتر می‌کند؟

منبع: arXiv AI