محققان به تازگی آسیبپذیری جدیدی به نام «CPInj» را در سیستمهای «بهینهسازی مشارکتی پرامپت» (TCPO) شناسایی کردهاند. در این سیستمها که به چندین کلاینت اجازه میدهند بدون اشتراکگذاری دادههای شخصی، پرامپتهای مدلهای زبانی را بهبود دهند، یک حفره امنیتی خطرناک وجود دارد.
بهگفته محققان، مهاجمان میتوانند با تزریق دستورات مخرب، فرآیند بهینهسازی را آلوده کرده و عملکرد مدل را در کارهای حساس (مثل ریاضی و پزشکی) مختل کنند. نکته نگرانکننده اینجاست که روشهای دفاعی فعلی در برابر این حملات چندان موثر نیستند؛ با این حال، تیم تحقیق یک روش دفاعی جدید به نام «APAgg» را نیز معرفی کردهاند که میتواند این دستورات مخرب را خنثی کند.
امنیت در هوش مصنوعی هر روز ابعاد پیچیدهتری پیدا میکند، بهخصوص وقتی پای سیستمهای مشارکتی در میان باشد! 🧠💻
منبع: arXiv AI
