آیا فکر میکنید استفاده از دادههای مصنوعی (Synthetic Data) برای آموزش مدلهای هوش مصنوعی، حریم خصوصی دادههای واقعی را کاملاً تضمین میکند؟ نتایج یک تحقیق جدید نشان میدهد که اتفاقاً قضیه برعکس است!
محققان در مقاله جدیدی به بررسی روش Real-Synthetic Mix-Training (RSMT) پرداختهاند و کشف کردند که ترکیب دادههای واقعی و مصنوعی، گاهی باعث میشود مدل به جای محافظت، «حریصتر» شود و دادههای واقعی را بیشتر به خاطر بسپارد (Memorization). این یعنی ریسک نشت اطلاعات و حملات استنتاج عضویت (MIA) به شدت افزایش مییابد.
این تیم ابزاری به نام RSMixLeak را معرفی کردهاند که به توسعهدهندگان کمک میکند تا این شکاف امنیتی را در مدلهای خود شناسایی کنند. یک یادآوری مهم برای همه ما که در دنیای توسعه هوش مصنوعی هستیم: دادههای مصنوعی معجزه نمیکنند و گاهی هزینههای پنهانی دارند!
منبع: arXiv Machine Learning
