🔍 چالش جدید در اخلاق هوش مصنوعی: بنچمارک PapersPlease

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا مدل‌های زبانی در تصمیم‌گیری‌های حساس، دچار سوگیری می‌شوند؟ محققان به‌تازگی بنچمارک جدیدی به نام «PapersPlease» را معرفی کرده‌اند که با استفاده از ۳۷۰۰ موقعیت اخلاقی و تئوری نیازهای انسانی (ERG)، نحوه اولویت‌بندی مدل‌های هوش مصنوعی را به چالش می‌کشد.

در این مطالعه، LLMها در نقش مأموران مهاجرت قرار گرفتند تا بر اساس شرایط افراد، تصمیم به پذیرش یا رد آن‌ها بگیرند. نتایج نگران‌کننده است: برخی مدل‌ها نه تنها اولویت‌های ضمنی خاصی دارند، بلکه نسبت به هویت‌های به حاشیه رانده‌شده، نرخ رد بیشتری نشان می‌دهند! این ابزار گامی مهم برای درک بهتر سوگیری‌های نهفته در هوش مصنوعی است. 🤖⚖️

منبع: arXiv NLP