محققان روش نفوذ جدیدی به نام «Sockpuppetting» را شناسایی کردهاند که امنیت مدلهای زبانی (LLMs) را به چالش میکشد! در این روش، با ترکیب تکنیکهای «Prefill» و بهینهسازی بردارهای جایگذاری (Suffix Optimization)، مهاجمان میتوانند راحتتر از سدهای امنیتی عبور کرده و مدل را به تولید پاسخهای ممنوعه وادار کنند.
نتایج نشان میدهد که استفاده از این روش، موفقیت حملات به مدلهایی مثل Llama-3.1 و Qwen3 را به طرز چشمگیری افزایش میدهد. این کشف زنگ خطری جدی برای توسعهدهندگان است تا مکانیزمهای دفاعی قویتری برای جلوگیری از نفوذ در ورودی و خروجیهای مدل طراحی کنند.
منبع: arXiv Machine Learning
