🛡 مقابله با «مسمومیت» مدل‌های هوش مصنوعی با تکنیک زیرفضای تطبیقی (Subspace-Constrained Adaptation)

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از بزرگترین دغدغه‌های امنیتی در دنیای مدل‌های زبانی، «حملات مسموم‌سازی» (Fine-tuning Poisoning) است که در آن داده‌های مخرب باعث تغییر رفتار مدل می‌شوند. محققان به تازگی راهکار هوشمندانه‌ای پیدا کرده‌اند!

🔹 این روش چیست؟
به جای باز گذاشتن فضای تغییر پارامترها در زمان Fine-tuning، مدل تنها محدود به «زیرفضاهای معتبر» می‌شود. با بررسی ۱۶۹ آداپتور مختلف، محققان متوجه شدند که اطلاعات کلیدی مدل در فضای بسیار کوچک‌تری نهفته است.

چرا این دستاورد مهم است؟
۱. امنیت بالا: این روش برخلاف متدهای رایج (مانند LoRA)، جلوی آموزش روی داده‌های خراب و مخرب را می‌گیرد.
۲. تشخیص خودکار: مدل می‌تواند داده‌های «تمیز» را از «زباله» با دقت بسیار بالایی (۱۲۰ برابر تفاوت در ضرر) تشخیص دهد.
۳. دفاع در برابر نفوذ: در برابر حملات Backdoor (درهای پشتی) که قصد تزریق رفتارهای مخفی به مدل را دارند، این روش عملکرد خیره‌کننده‌ای در مسدودسازی حملات نشان داده است.

این تحقیق گامی مهم برای ایمن‌سازی مدل‌های هوش مصنوعی در محیط‌های واقعی است. 🚀

منبع: arXiv Machine Learning