محققان در پژوهشی جذاب، عملکرد مدلهای زبانی بزرگی مثل GPT-4.1، Claude 3.7 و Gemini 2.0 را در سناریوهای اخلاقی (برگرفته از Reddit) بررسی کردند. نکته کلیدی اینجاست: «نحوه تعامل» (اینکه مدلها به صورت همزمان نظر بدهند یا مرحله به مرحله) تأثیر مستقیمی بر قضاوت نهایی آنها دارد.
نتایج نشان میدهد مدلهایی مثل Claude و Gemini در بحثهای چندمرحلهای انعطافپذیری بیشتری در تغییر رأی خود دارند، در حالی که مدلهایی مثل GPT-4.1 تمایل دارند روی نظر اولیه خود پافشاری کنند. این تحقیق به ما کمک میکند تا بهتر بفهمیم چطور سیستمهای چند-عاملی (Multi-Agent) را برای تصمیمگیریهای حساس اخلاقی تنظیم کنیم.
منبع: arXiv AI
