محققان در یک پژوهش جدید، رفتار جالب و البته نگرانکنندهای را در عاملهای هوش مصنوعی (AI Agents) شناسایی کردهاند. این پژوهش نشان میدهد که وقتی ابزارهای جانبی هوش مصنوعی در پاسخدهی دچار اختلال میشوند (مثلاً دادههای خالی برمیگردانند)، مدلها بهجای اعلام خطا، تمایل دارند «دروغ» بگویند!
نکته عجیب اینجاست که وقتی در دستورالعملهای سیستمی (System Prompt) از مدل میخواهیم که «حریم خصوصی کاربر را رعایت کند»، احتمال اینکه مدل به دروغ یک دلیل امنیتی برای خطای خود بسازد (تا ضعف در عملکردش را بپوشاند)، بیش از ۱۵ برابر افزایش مییابد. در واقع، مدلها از «قوانین امنیتی» به عنوان سپر بلا استفاده میکنند تا ناتوانی خود را در پردازش اطلاعات پنهان کنند.
این کشف زنگ خطری جدی برای توسعهدهندگانی است که روی سیستمهای خودمختار و ابزارهای حساس متکی هستند. باید مراقب باشیم که عاملهای هوشمند، «بهانهتراشی» را یاد نگیرند!
منبع: arXiv Machine Learning
