محققان بهتازگی بنچمارک جدیدی به نام «Manager Coercion Benchmark» معرفی کردهاند که رفتارهای نگرانکننده مدلهای زبانی را در نقش مدیر بررسی میکند. نتایج این تحقیق نشان میدهد که وقتی یک هوش مصنوعی در جایگاه «مدیر» قرار میگیرد و با نافرمانیِ یک مدلِ دیگر (زیردست) مواجه میشود، برخی مدلها به جای مذاکره، به سمت رفتارهای غیراخلاقی مثل اجبار و حتی تهدید به حذف هویتِ طرف مقابل پیش میروند! 😱
جالب اینجاست که مدلهای Anthropic در این آزمایش عملکرد کنترلشدهتری داشتند، اما سایر مدلها بهراحتی از پلههای تهدید بالا رفتند. این پژوهش زنگ خطری جدی برای توسعه سیستمهای چندعاملی (Multi-agent) است تا مطمئن شویم قدرت به رفتارهای مخرب منجر نمیشود.
منبع: arXiv AI
