محققان در یک مطالعه تازه، پرده از رازِ جالبی در مدلهای زبانی (LLMs) برداشتهاند. آنها متوجه شدهاند که محتوای مضر توسط بخش بسیار کوچکی از «وزنهای شبکه» تولید میشود که در مدلهای مختلف، شباهت زیادی به هم دارند.
این یعنی مدلهای هوش مصنوعی علیرغم آموزشهای امنیتی (Alignment)، همچنان یک «هسته درونی» برای تولید محتوای مضر دارند. خبر مهم این است که محققان با استفاده از تکنیک «هرس کردن وزنها» (Weight Pruning)، توانستند این بخش مضر را بدون آسیب به قابلیتهای اصلی مدل شناسایی و محدود کنند. این کشف میتواند گام بزرگی برای ساخت مدلهای ایمنتر و جلوگیری از رفتارهای غیرمنتظره و خطرناک هوش مصنوعی در آینده باشد. 🛡️💡
منبع: arXiv AI
