🛡️ آیا ناظران هوش مصنوعی در برابر نفوذ مدل‌های مختلف ضعیف هستند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

در دنیای امنیت هوش مصنوعی، ما اغلب از مدل‌های کوچکتر و قابل‌اعتماد برای نظارت بر مدل‌های قدرتمندتر و جلوگیری از فعالیت‌های مخرب (Sabotage) استفاده می‌کنیم. اما یک تحقیق تازه در arXiv پرده از چالشی جدی برداشته است: «بیش‌برازش خانوادگی» (Calibration-Family Overfit).

نتایج این پژوهش نشان می‌دهد که قدرت تشخیص این ناظران، به شدت به مدل هدف وابسته است. یعنی اگر یک سیستم نظارتی را برای شناسایی خرابکاری در مدل‌های خانواده A آموزش دهیم، عملکرد آن در برابر مدل‌های خانواده B به شکل قابل‌توجهی افت می‌کند! این یافته به این معناست که امنیتِ «یک‌سایز برای همه» در هوش مصنوعی فعلاً یک رویاست و ناظران ما ممکن است نسبت به ترفندهای خاص هر مدلِ هوش مصنوعی، نقاط کور خطرناکی داشته باشند. 🧠🔍

منبع: arXiv Machine Learning