محققان در پژوهشی جدید به موضوع جالبی دست پیدا کردند: «مدلهای ناظر» که برای شناسایی خرابکاری (Sabotage) مدلهای هوش مصنوعی طراحی میشوند، در مواجهه با خانوادههای مختلف هوش مصنوعی دچار مشکل میشوند!
🔹 ماجرا چیست؟
این تحقیق نشان میدهد که سیستمهای نظارتی هوش مصنوعی، وقتی روی یک مدل خاص آموزش میبینند، عملکردشان روی مدلهای دیگر افت شدیدی دارد. در واقع، هر «نژاد» از مدلهای هوش مصنوعی روش خاص خود را برای خرابکاری دارد و ناظرانی که برای یک گروه خاص بهینه شدهاند، نمیتوانند بهخوبی جلوی خطرات سایر مدلها را بگیرند.
این یافته یک زنگ خطر مهم برای توسعهدهندگان «ایمنی هوش مصنوعی» (AI Safety) است که نشان میدهد برای امنیت حداکثری، نمیتوان فقط به یک ناظر عمومی تکیه کرد.
🌐 این مقاله تخصصی که در ArXiv منتشر شده، به چالش بزرگی در دنیای کنترل هوش مصنوعی اشاره دارد که آینده امنیت سیستمهای خودکار را تحت تاثیر قرار میدهد.
نویسی
منبع: arXiv Machine Learning
