🔍 کشفِ ساختار درونیِ «شرارت» در مدل‌های زبانی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک مطالعه تازه، پرده از رازِ جالبی در مدل‌های زبانی (LLMs) برداشته‌اند. آن‌ها متوجه شده‌اند که محتوای مضر توسط بخش بسیار کوچکی از «وزن‌های شبکه» تولید می‌شود که در مدل‌های مختلف، شباهت زیادی به هم دارند.

این یعنی مدل‌های هوش مصنوعی علیرغم آموزش‌های امنیتی (Alignment)، همچنان یک «هسته درونی» برای تولید محتوای مضر دارند. خبر مهم این است که محققان با استفاده از تکنیک «هرس کردن وزن‌ها» (Weight Pruning)، توانستند این بخش مضر را بدون آسیب به قابلیت‌های اصلی مدل شناسایی و محدود کنند. این کشف می‌تواند گام بزرگی برای ساخت مدل‌های ایمن‌تر و جلوگیری از رفتارهای غیرمنتظره و خطرناک هوش مصنوعی در آینده باشد. 🛡️💡

منبع: arXiv AI