یکی از بزرگترین چالشهای دنیای آموزش مدلهای هوش مصنوعی، حملات «بکدور» (Backdoor Attacks) است که در آن دادههای آلوده، مدل را به رفتارهای ناخواسته وادار میکنند.
محققان در مقاله جدیدی، روشی نوآورانه به نام «Anti-Backdoor Coreset Selection» معرفی کردهاند. این تکنیک با استفاده از مفهومی به نام «Cumulative Entropy»، دادههای سالم را از دادههای مسموم تفکیک میکند.
نکته جذاب اینجاست که این روش بدون افت دقت مدل در کارهای معمول، به شکلی هوشمندانه از آموزش مدل روی دادههای آلوده جلوگیری میکند و لایهای امنیتی برای نسل جدید مدلهای هوش مصنوعی فراهم میآورد. 💡
منبع: arXiv Machine Learning
