🛡 آیا فیلترهای Regex واقعاً امنیت مدل‌های هوش مصنوعی را تضمین می‌کنند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مطالعه جدید خود، کارایی فیلترهای متنی (Regex) را که معمولاً در لایه جلویی مدل‌های زبانی (LLM) برای جلوگیری از تولید محتوای مضر قرار می‌گیرند، به چالش کشیده‌اند.

بر اساس نتایج این تحقیق، این فیلترها در برابر حملات هدفمند (Adversarial Probes) تقریباً ناکارآمد هستند! نکته جالب اینجاست که حتی وقتی فیلترها دور زده می‌شوند، مکانیزم‌های «همسوسازی» (Alignment) خودِ مدل، همچنان در حال پاسخ‌دهی هستند، اما خروجی آن‌ها به قدری دقیق و ظریف است که ابزارهای ساده تشخیص متن قادر به شناسایی آن‌ها نیستند. این یعنی برای امنیت واقعی هوش مصنوعی، نباید صرفاً به فیلترهای ساده تکیه کرد. 🤖🔍

منبع: arXiv AI