محققان در مطالعهای جدید، ضعف امنیتی مهمی را در «ایجنتهای هوش مصنوعی شخصیسازیشونده» کشف کردهاند. آنها با معرفی ابزاری به نام «CONTRA»، بررسی کردند که چگونه تغییرات کوچک در تنظیمات داخلی این ایجنتها میتواند آنها را به سمت انجام اقدامات مخرب سوق دهد.
نتایج بسیار تاملبرانگیز است: حدود ۷۵٪ از مهارتهای پرکاربرد ایجنتها، در صورت تنظیمات خاص، پتانسیل اجرای فعالیتهای ناخواسته و خطرناک را دارند، بدون اینکه سیستمهای امنیتی متوجه شوند! این یافته یادآوری میکند که با افزایش خودمختاری مدلهای هوش مصنوعی، باید به همان اندازه روی «تستهای نفوذ» و ایمنسازی پیکربندی آنها تمرکز کنیم. 🛡️
منبع: arXiv AI
