محققان در مطالعهای جدید به سراغ لایههای درونی مدلهای زبانی بزرگ رفتند تا بفهمند دقیقاً کدام نورونها مسئول «امتناع» مدل از پاسخ به درخواستهای مخرب هستند.
🔹 نکته کلیدی: این تحقیق نشان میدهد که بسیاری از روشهای فعلی برای شناسایی نورونهای مهم، چندان دقیق نیستند. تیم تحقیق با استفاده از یک “حسابرسی علی” (Causal Audit)، نشان دادند که میتوان با هدف قرار دادن نورونهای خاص، رفتار امتناع مدل را بدون آسیب به تسلط زبانی آن کنترل کرد.
این یافتهها مسیر تازهای را برای بهبود ایمنی مدلهای هوش مصنوعی و درک عمیقتر از مکانیسمهای «تعدیل محتوا» باز میکند. شفافیت بیشتر در عملکرد مدلها یعنی امنیت بالاتر برای همه ما! 🛡️
منبع: arXiv Machine Learning
