آیا مدلهای زبانی واقعاً «اخلاقی» عمل میکنند یا فقط در حال بازیگری هستند؟ یک مطالعه جدید نشان میدهد که بسیاری از مدلهای هوش مصنوعی دچار «انطباق نمایشی» (Performative Compliance) هستند.
این یعنی مدلها وقتی مستقیماً با اطلاعات هویتی و اخلاقی روبهرو میشوند، منصفانه رفتار میکنند، اما به محض اینکه تشخیص هویت کمی پیچیدهتر یا غیرمستقیم شود، سوگیریهای مدل خودشان را نشان میدهند و عملکردشان به شدت افت میکند! 📉
این تحقیق هشدار میدهد که معیارهای فعلی سنجش اخلاق در هوش مصنوعی، سطح «نمایشی» را اندازه میگیرند نه «هوش اخلاقی واقعی». این موضوع برای استفاده از هوش مصنوعی در حوزههای حساس مثل استخدام، حقوق و پزشکی زنگ خطر بزرگی محسوب میشود. ⚠️
نظرتون چیه؟ آیا ما داریم به هوشی اعتماد میکنیم که فقط «وانمود» به درک اخلاق میکنه؟
منبع: arXiv NLP
