محققان تکنیک جدیدی برای دور زدن فیلترهای مدلهای زبانی (Jailbreak) ابداع کردهاند که به جای روشهای سنتی، از «تفسیرپذیری مکانیکی» (Mechanistic Interpretability) استفاده میکند. در این روش، با شناسایی فضاهای داخلی مدل که مسئول پاسخدهی یا امتناع هستند، میتوان رفتار مدل را به سمت پذیرش دستورات تغییر داد.
نکته جالب اینجاست که این تکنیک روی مدلهای قدرتمندی مثل Llama 3.2 و Gemma 2 با نرخ موفقیت بالای ۸۰ درصد و در عرض چند ثانیه عمل میکند! این دستاورد هم یک زنگ خطر برای امنیت مدلهاست و هم راهی جدید برای توسعهدهندگان جهت ساخت دیوارههای دفاعی مستحکمتر.
این تحقیق نشان میدهد که درک ساختار درونی مدلها چقدر میتواند در تامین امنیت آنها حیاتی باشد. جزئیات بیشتر و کدهای این پروژه در گیتهاب برای علاقهمندان در دسترس است. 💡
منبع: arXiv AI
