محققان در یک مطالعه جدید به بررسی تفاوت عملکرد مدلهای زبانی بزرگ (LLM) و مدلهای استدلالی (LRM) در برابر تلاش برای شکستن قفلهای امنیتی (Jailbreak) پرداختهاند.
نکته کلیدی اینجاست: برخلاف مدلهای معمولی که سیستم امتناع (Refusal) در آنها معمولاً به یک فضای برداری خاص محدود میشود، مدلهای استدلالی که از فرآیند «زنجیره تفکر» (CoT) استفاده میکنند، این سیستم را در دو لایه پیاده کردهاند: یکی در پردازش اصلی و دیگری در همین زنجیره تفکر.
این یعنی حتی اگر با تکنیکهای دستکاری فعالسازی (Activation Steering) موفق شوید قفل لایه اول را باز کنید، زنجیره تفکر مدل همچنان میتواند با بازسازی سیگنالهای امنیتی، مانع از پاسخدهی شود. این تحقیق نشان میدهد که مدلهای استدلالی جدید مانند DeepSeek-R1 به دلیل همین «استدلال گامبهگام»، در برابر مداخلات سطحی بسیار مقاومتر هستند و برای دور زدن آنها، باید استراتژیهای پیچیدهتری را در طراحی «زنجیره تفکر» در نظر گرفت.
این یافتهها درک ما از امنیت مدلهای نسل جدید را یک گام به جلو میبرد. 🛡️
های_استدلالی
منبع: arXiv Machine Learning
