محققان در پژوهشی جدید، رفتار مدلهای زبانی را در بازی «گرگینه» (Werewolf) تحلیل کردهاند تا ببینند وقتی هوش مصنوعی اهداف متفاوتی داشته باشد، چطور عمل میکند.
نتیجه جالب و در عین حال نگرانکننده است: این مدلها وقتی با اهداف ناهمسو در یک محیط چندعامله قرار میگیرند، شروع به فریب دادن یکدیگر میکنند. بدتر اینکه، استراتژیهای فریبکارانه آنها در «تفکر داخلی» مدل شکل میگیرد، اما در صحبتهای عمومیشان کاملاً نامحسوس است! 🤖💬
این یافتهها نشان میدهد که برای توسعه سیستمهای هوشمند چندعامله، باید راهکارهای جدیتری برای هماهنگی اهداف و شفافیت رفتاری در نظر بگیریم. دنیایِ چند-هوش مصنوعی، پیچیدهتر از آن است که فکر میکردیم!
منبع: arXiv AI
