🛡️ آسیب‌پذیری جدید در مدل‌های زبانی: حمله Sockpuppetting چیست؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان روش نفوذ جدیدی به نام «Sockpuppetting» را شناسایی کرده‌اند که امنیت مدل‌های زبانی (LLMs) را به چالش می‌کشد! در این روش، با ترکیب تکنیک‌های «Prefill» و بهینه‌سازی بردارهای جای‌گذاری (Suffix Optimization)، مهاجمان می‌توانند راحت‌تر از سدهای امنیتی عبور کرده و مدل را به تولید پاسخ‌های ممنوعه وادار کنند.

نتایج نشان می‌دهد که استفاده از این روش، موفقیت حملات به مدل‌هایی مثل Llama-3.1 و Qwen3 را به طرز چشم‌گیری افزایش می‌دهد. این کشف زنگ خطری جدی برای توسعه‌دهندگان است تا مکانیزم‌های دفاعی قوی‌تری برای جلوگیری از نفوذ در ورودی و خروجی‌های مدل طراحی کنند.

منبع: arXiv Machine Learning