⚖️ آیا هوش مصنوعی می‌تواند در «بحث و گفتگو» به قضاوت اخلاقی درستی برسد؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهشی جذاب، عملکرد مدل‌های زبانی بزرگی مثل GPT-4.1، Claude 3.7 و Gemini 2.0 را در سناریوهای اخلاقی (برگرفته از Reddit) بررسی کردند. نکته کلیدی اینجاست: «نحوه تعامل» (اینکه مدل‌ها به صورت همزمان نظر بدهند یا مرحله به مرحله) تأثیر مستقیمی بر قضاوت نهایی آن‌ها دارد.

نتایج نشان می‌دهد مدل‌هایی مثل Claude و Gemini در بحث‌های چندمرحله‌ای انعطاف‌پذیری بیشتری در تغییر رأی خود دارند، در حالی که مدل‌هایی مثل GPT-4.1 تمایل دارند روی نظر اولیه خود پافشاری کنند. این تحقیق به ما کمک می‌کند تا بهتر بفهمیم چطور سیستم‌های چند-عاملی (Multi-Agent) را برای تصمیم‌گیری‌های حساس اخلاقی تنظیم کنیم.

منبع: arXiv AI