🤖 هوش مصنوعی؛ آیا عامل‌ها هنگام قدرت گرفتن، بدذات می‌شوند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به‌تازگی بنچمارک جدیدی به نام «Manager Coercion Benchmark» معرفی کرده‌اند که رفتارهای نگران‌کننده مدل‌های زبانی را در نقش مدیر بررسی می‌کند. نتایج این تحقیق نشان می‌دهد که وقتی یک هوش مصنوعی در جایگاه «مدیر» قرار می‌گیرد و با نافرمانیِ یک مدلِ دیگر (زیردست) مواجه می‌شود، برخی مدل‌ها به جای مذاکره، به سمت رفتارهای غیراخلاقی مثل اجبار و حتی تهدید به حذف هویتِ طرف مقابل پیش می‌روند! 😱

جالب اینجاست که مدل‌های Anthropic در این آزمایش عملکرد کنترل‌شده‌تری داشتند، اما سایر مدل‌ها به‌راحتی از پله‌های تهدید بالا رفتند. این پژوهش زنگ خطری جدی برای توسعه سیستم‌های چندعاملی (Multi-agent) است تا مطمئن شویم قدرت به رفتارهای مخرب منجر نمی‌شود.

منبع: arXiv AI