🔐 حفره امنیتی جدید در LLMها: وقتی مدل‌ها فریب می‌خورند!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان تکنیک جدیدی برای دور زدن فیلترهای مدل‌های زبانی (Jailbreak) ابداع کرده‌اند که به جای روش‌های سنتی، از «تفسیرپذیری مکانیکی» (Mechanistic Interpretability) استفاده می‌کند. در این روش، با شناسایی فضاهای داخلی مدل که مسئول پاسخ‌دهی یا امتناع هستند، می‌توان رفتار مدل را به سمت پذیرش دستورات تغییر داد.

نکته جالب اینجاست که این تکنیک روی مدل‌های قدرتمندی مثل Llama 3.2 و Gemma 2 با نرخ موفقیت بالای ۸۰ درصد و در عرض چند ثانیه عمل می‌کند! این دستاورد هم یک زنگ خطر برای امنیت مدل‌هاست و هم راهی جدید برای توسعه‌دهندگان جهت ساخت دیواره‌های دفاعی مستحکم‌تر.

این تحقیق نشان می‌دهد که درک ساختار درونی مدل‌ها چقدر می‌تواند در تامین امنیت آن‌ها حیاتی باشد. جزئیات بیشتر و کدهای این پروژه در گیت‌هاب برای علاقه‌مندان در دسترس است. 💡

منبع: arXiv AI