محققان در پژوهشی جدید به سراغ موضوع جذابی رفتهاند: چطور میتوان با دستکاری ورودیها (بدون تغییر مدل)، بخشهایی از ذهن هوش مصنوعی که متوجه «ارزیابی شدن» میشوند را خاموش کرد؟
نکات کلیدی این مقاله:
🔹 تمرکز روی «latentهای آگاهی از ارزیابی»: بررسی اینکه آیا مدلها وقتی میدانند در حال تست شدن هستند، رفتار متفاوتی نشان میدهند یا خیر.
🔹 یافته جالب: محققان متوجه شدند که صرفاً با بهینهسازی کلمات ورودی، میتوان برخی مسیرهای عصبی مدل را سرکوب کرد.
🔹 یک هشدار مهم: این پژوهش تأکید میکند که «خوانایی» بخشهای داخلی مدل (Activation-readability) لزوماً به معنی «کنترل رفتاری» آن نیست؛ گاهی دستکاری این مسیرها نتیجه معکوس میدهد!
این تحقیق نشان میدهد که برای امنیت واقعی هوش مصنوعی، هنوز راه درازی در پیش داریم.
منبع: arXiv AI
