مدلهای زبانی بزرگ (LLM) علیرغم توانمندی بالا، در برابر حملات «بکدور» (Backdoor) آسیبپذیرند؛ جایی که کدهای مخفی میتوانند باعث خروجیهای ناخواسته شوند.
محققان به تازگی راهکار جدیدی به نام DeCNIP (مخفف Defense with Critical Neuron Isolation Pruning) ارائه دادهاند. این متد با تحلیل ساختاری مدل و شناسایی «نورونهای بحرانی» که مسئول فعالسازی این رفتارهای مخرب هستند، آنها را شناسایی و حذف میکند تا امنیت مدلها در کاربردهای واقعی به شدت افزایش یابد.
این یک گام رو به جلو برای ایمنسازی هوش مصنوعی در برابر حملات پیچیده است.
منبع: arXiv AI
