در دنیای امنیت هوش مصنوعی، ما اغلب از مدلهای کوچکتر و قابلاعتماد برای نظارت بر مدلهای قدرتمندتر و جلوگیری از فعالیتهای مخرب (Sabotage) استفاده میکنیم. اما یک تحقیق تازه در arXiv پرده از چالشی جدی برداشته است: «بیشبرازش خانوادگی» (Calibration-Family Overfit).
نتایج این پژوهش نشان میدهد که قدرت تشخیص این ناظران، به شدت به مدل هدف وابسته است. یعنی اگر یک سیستم نظارتی را برای شناسایی خرابکاری در مدلهای خانواده A آموزش دهیم، عملکرد آن در برابر مدلهای خانواده B به شکل قابلتوجهی افت میکند! این یافته به این معناست که امنیتِ «یکسایز برای همه» در هوش مصنوعی فعلاً یک رویاست و ناظران ما ممکن است نسبت به ترفندهای خاص هر مدلِ هوش مصنوعی، نقاط کور خطرناکی داشته باشند. 🧠🔍
منبع: arXiv Machine Learning
