یکی از بزرگترین دغدغههای امنیتی در دنیای مدلهای زبانی، «حملات مسمومسازی» (Fine-tuning Poisoning) است که در آن دادههای مخرب باعث تغییر رفتار مدل میشوند. محققان به تازگی راهکار هوشمندانهای پیدا کردهاند!
🔹 این روش چیست؟
به جای باز گذاشتن فضای تغییر پارامترها در زمان Fine-tuning، مدل تنها محدود به «زیرفضاهای معتبر» میشود. با بررسی ۱۶۹ آداپتور مختلف، محققان متوجه شدند که اطلاعات کلیدی مدل در فضای بسیار کوچکتری نهفته است.
✨ چرا این دستاورد مهم است؟
۱. امنیت بالا: این روش برخلاف متدهای رایج (مانند LoRA)، جلوی آموزش روی دادههای خراب و مخرب را میگیرد.
۲. تشخیص خودکار: مدل میتواند دادههای «تمیز» را از «زباله» با دقت بسیار بالایی (۱۲۰ برابر تفاوت در ضرر) تشخیص دهد.
۳. دفاع در برابر نفوذ: در برابر حملات Backdoor (درهای پشتی) که قصد تزریق رفتارهای مخفی به مدل را دارند، این روش عملکرد خیرهکنندهای در مسدودسازی حملات نشان داده است.
این تحقیق گامی مهم برای ایمنسازی مدلهای هوش مصنوعی در محیطهای واقعی است. 🚀
منبع: arXiv Machine Learning
