محققان در پژوهش جدیدی هشدار دادند که مدلهای زبانی (LLMs) میتوانند از طریق «پروپاگاندای محاسباتی» و در مرحله پیشآموزش (Pretraining) هدف حمله قرار بگیرند. برخلاف روشهای قدیمی، مهاجمان اکنون میتوانند با تزریق محتوای مخرب در محیطهای گفتگوی آنلاین عمومی، دادههای آموزشی مدلها را مسموم کنند.
این تیم ابزاری به نام «HalfLife» معرفی کردهاند که میتواند احتمال وجود محتوای خصمانه در دادههای خزش وب (Web-crawl) را تحلیل کند. این دستاورد زنگ خطری جدی برای توسعهدهندگان است تا امنیت دادههای ورودی به مدلها را بیش از پیش جدی بگیرند.
منبع: arXiv NLP
