یکی از چالشهای بزرگ در امنیت هوش مصنوعی، بحث «Unlearning» یا همان پاکسازی دادههای حساس از حافظه مدلهاست. اما چطور بفهمیم یک مدل واقعاً دادهها را حذف کرده یا فقط تظاهر میکند؟
محققان در یک پژوهش جدید، ابزاری برای ارزیابی دقیق الگوریتمهای حذف داده معرفی کردهاند. نتایج نشان میدهد که بسیاری از روشهای رایج (مثل تنظیم دقیق یا Fine-tuning)، در پاکسازی واقعی دادهها ضعیف عمل میکنند و تنها روشهای سختگیرانهتری مانند «مدلکلیپینگ» موفق به حذف کامل اثر دادههای آموزشی شدهاند.
این ابزار جدید حالا به متخصصان کمک میکند تا ادعاهای ایمنی مدلها را به چالش بکشند و امنیت دادهها را جدیتر بگیرند. 🛡️
منبع: arXiv Machine Learning
