محققان در پژوهشی جدید به سراغ یکی از بزرگترین چالشهای مدلهای زبانی (LLM) رفتهاند: «مدیریت تضادهای ارزشی».
وقتی مدلها با پاداشهای ساده آموزش میبینند، در درک پیچیدگیهای اخلاقی دچار سردرگمی میشوند. این مقاله نشان میدهد که استفاده از روش «زنجیره تفکر» (CoT) نه تنها به بهبود استدلال کمک میکند، بلکه با هموار کردن چشمانداز بهینهسازی مدل، آن را در مواجهه با مسائل حساس اخلاقی و ارزشهای انسانی پایدارتر و دقیقتر میکند. این گام بزرگی برای رسیدن به مدلهایی با رفتارهای منصفانهتر و مسئولیتپذیرتر است. ✨
منبع: arXiv AI
