محققان در مطالعهای جدید به سراغ یکی از موضوعات حیاتی و حساس در مدلهای زبانی (LLMs) رفتهاند: «نحوه بازنمایی محتوای مرتبط با آسیب به خود (Self-harm)».
این پژوهش نشان میدهد که اطلاعات مربوط به این محتواها در ۳ تا ۷ درصد لایههای پایانی شبکههای عصبی متمرکز شدهاند. درک این «جهتهای کنتراستیک» به دانشمندان کمک میکند تا ابزارهای دقیقتری برای شناسایی و پیشگیری از رفتارهای پرخطر توسط هوش مصنوعی طراحی کنند. این گام مهمی در جهت افزایش ایمنی و مسئولیتپذیری مدلهای هوش مصنوعی در کاربردهای دنیای واقعی است. 🛡️
منبع: arXiv NLP
