🧠 واکاوی رفتارهای حساس در مدل‌های زبانی: شناخت بهتر آسیب‌های خودآزارانه

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مطالعه‌ای جدید به سراغ یکی از موضوعات حیاتی و حساس در مدل‌های زبانی (LLMs) رفته‌اند: «نحوه بازنمایی محتوای مرتبط با آسیب به خود (Self-harm)».

این پژوهش نشان می‌دهد که اطلاعات مربوط به این محتواها در ۳ تا ۷ درصد لایه‌های پایانی شبکه‌های عصبی متمرکز شده‌اند. درک این «جهت‌های کنتراستیک» به دانشمندان کمک می‌کند تا ابزارهای دقیق‌تری برای شناسایی و پیشگیری از رفتارهای پرخطر توسط هوش مصنوعی طراحی کنند. این گام مهمی در جهت افزایش ایمنی و مسئولیت‌پذیری مدل‌های هوش مصنوعی در کاربردهای دنیای واقعی است. 🛡️

منبع: arXiv NLP