محققان در پژوهشی جدید به سراغ موضوع جذابی رفتند: چطور میتوان دادههای مخفی را درون خروجیهای هوش مصنوعی (LLMs) جاسازی کرد؟ این تکنیک که به آن «استگانوگرافی» میگویند، میتواند تهدیدی برای امنیت مدلها باشد.
نکته کلیدی این تحقیق این است که روشهای سنتی دیگر برای شناسایی این پیامهای مخفی کافی نیستند. آنها بهجای بررسی توزیع دادهها، از تکنیک «تفسیرپذیری مکانیکی» استفاده کردند تا ردپای این پیامهای مخفی را در لایههای داخلی مدل پیدا کنند. این روش جدید، شناسایی حملات فینتیونینگ مخرب را بسیار دقیقتر از قبل کرده است. 🛡️
دنیای امنیت هوش مصنوعی هر روز پیچیدهتر میشود و درک این لایههای پنهان برای توسعهدهندگان حیاتی است!
منبع: arXiv AI
