تا حالا فکر کردهاید که مدلهای زبانی (LLM) وقتی با موقعیتهای اخلاقی و ارزشی مواجه میشوند، چقدر دقیق عمل میکنند؟ در یک تحقیق علمی جدید، محققان ۲۱ مدل مختلف را بر اساس نظریه ارزشهای شوارتز (Schwartz) بررسی کردند.
نتایج نشان میدهد که اگرچه این مدلها تا حد زیادی مفهوم کلی ارزشها را درک میکنند، اما در تشخیص دقیق آنها هنوز دچار خطاهای سیستماتیک هستند. برای مثال، مدلها گاهی ارزشهایی مثل «امنیت» را با «قدرت» اشتباه میگیرند یا مرز بین «لذتجویی» و «تحرک» برایشان مبهم است.
این تحقیق به ما یادآوری میکند که برای رسیدن به هوش مصنوعی واقعاً همسو با اخلاقیات انسانی، هنوز مسیر زیادی در درک دقیق مفاهیم انتزاعی در پیش داریم. 🎯
منبع: arXiv NLP
