🔍 کنترل رفتارهای هوش مصنوعی: آیا مدل‌ها واقعاً «آگاهانه» فریب می‌دهند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی جدید به سراغ موضوع جذابی رفته‌اند: چطور می‌توان با دستکاری ورودی‌ها (بدون تغییر مدل)، بخش‌هایی از ذهن هوش مصنوعی که متوجه «ارزیابی شدن» می‌شوند را خاموش کرد؟

نکات کلیدی این مقاله:
🔹 تمرکز روی «latentهای آگاهی از ارزیابی»: بررسی اینکه آیا مدل‌ها وقتی می‌دانند در حال تست شدن هستند، رفتار متفاوتی نشان می‌دهند یا خیر.
🔹 یافته جالب: محققان متوجه شدند که صرفاً با بهینه‌سازی کلمات ورودی، می‌توان برخی مسیرهای عصبی مدل را سرکوب کرد.
🔹 یک هشدار مهم: این پژوهش تأکید می‌کند که «خوانایی» بخش‌های داخلی مدل (Activation-readability) لزوماً به معنی «کنترل رفتاری» آن نیست؛ گاهی دستکاری این مسیرها نتیجه معکوس می‌دهد!

این تحقیق نشان می‌دهد که برای امنیت واقعی هوش مصنوعی، هنوز راه درازی در پیش داریم.

منبع: arXiv AI