محققان در مطالعه جدید خود، کارایی فیلترهای متنی (Regex) را که معمولاً در لایه جلویی مدلهای زبانی (LLM) برای جلوگیری از تولید محتوای مضر قرار میگیرند، به چالش کشیدهاند.
بر اساس نتایج این تحقیق، این فیلترها در برابر حملات هدفمند (Adversarial Probes) تقریباً ناکارآمد هستند! نکته جالب اینجاست که حتی وقتی فیلترها دور زده میشوند، مکانیزمهای «همسوسازی» (Alignment) خودِ مدل، همچنان در حال پاسخدهی هستند، اما خروجی آنها به قدری دقیق و ظریف است که ابزارهای ساده تشخیص متن قادر به شناسایی آنها نیستند. این یعنی برای امنیت واقعی هوش مصنوعی، نباید صرفاً به فیلترهای ساده تکیه کرد. 🤖🔍
منبع: arXiv AI
