🛡 چگونه امنیت هوش مصنوعی را در برابر دور زدن نظارت‌ها تضمین کنیم؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهشی جدید به بررسی ضعف‌های «نظارت‌گرهای جعبه‌سفید» (White-box Monitors) در مدل‌های زبانی بزرگ پرداخته‌اند. این مدل‌ها که برای اطمینان از عملکرد ایمن هوش مصنوعی طراحی شده‌اند، گاهی با ترفندهای هوشمندانه دور زده می‌شوند.

این مطالعه نشان می‌دهد که مهاجمان با تغییر هندسی اطلاعات و دستکاری کوواریانس، هوش مصنوعی را فریب می‌دهند. برای مقابله با این تهدید، ابزار جدیدی به نام SafetyNet معرفی شده که با رویکردی چندلایه، امنیت و دقت تشخیص خطرات را به‌طور چشمگیری بهبود می‌بخشد و در بنچمارک‌های مهم، عملکردی درخشان داشته است. این پیشرفت گام بزرگی برای ساخت هوش مصنوعی ایمن‌تر و قابل‌اعتمادتر محسوب می‌شود. 🤖✨

منبع: arXiv AI