🧠 رمزگشایی از ذهن مدل‌های زبانی؛ وقتی هوش مصنوعی «نه» می‌گوید!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه‌ای جدید به سراغ لایه‌های درونی مدل‌های زبانی بزرگ رفتند تا بفهمند دقیقاً کدام نورون‌ها مسئول «امتناع» مدل از پاسخ به درخواست‌های مخرب هستند.

🔹 نکته کلیدی: این تحقیق نشان می‌دهد که بسیاری از روش‌های فعلی برای شناسایی نورون‌های مهم، چندان دقیق نیستند. تیم تحقیق با استفاده از یک “حسابرسی علی” (Causal Audit)، نشان دادند که می‌توان با هدف قرار دادن نورون‌های خاص، رفتار امتناع مدل را بدون آسیب به تسلط زبانی آن کنترل کرد.

این یافته‌ها مسیر تازه‌ای را برای بهبود ایمنی مدل‌های هوش مصنوعی و درک عمیق‌تر از مکانیسم‌های «تعدیل محتوا» باز می‌کند. شفافیت بیشتر در عملکرد مدل‌ها یعنی امنیت بالاتر برای همه ما! 🛡️

منبع: arXiv Machine Learning