محققان تکنیک خلاقانهای به نام «واترمارکینگ فعالسازی» (AWM) را معرفی کردهاند که امنیت مدلهای زبانی (LLM) را در برابر حملات هدفمند بهشدت افزایش میدهد.
مشکل اینجاست که مهاجمان با دسترسی به مدل، میتوانند بهصورت آفلاین نقاط ضعف و پرامپتهای مخرب را شناسایی کنند. روش AWM با استفاده از «واترمارک» در لایههای پنهان مدل، مسیرهای خروجی را تصادفیسازی میکند. نتیجه؟ نرخ موفقیت حملات مهاجمان به شدت کاهش پیدا کرده و مدلها در برابر نفوذ مقاومتر میشوند. این یک گام مهم برای امنسازی مدلهای تجاری در برابر سواستفادههاست! 🤖🔒
منبع: arXiv AI
