🧠 چرا دور زدنِ سیستم‌های ایمنی در مدل‌های استدلالی سخت‌تر است؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک مطالعه جدید به بررسی تفاوت عملکرد مدل‌های زبانی بزرگ (LLM) و مدل‌های استدلالی (LRM) در برابر تلاش برای شکستن قفل‌های امنیتی (Jailbreak) پرداخته‌اند.

نکته کلیدی اینجاست: برخلاف مدل‌های معمولی که سیستم امتناع (Refusal) در آن‌ها معمولاً به یک فضای برداری خاص محدود می‌شود، مدل‌های استدلالی که از فرآیند «زنجیره تفکر» (CoT) استفاده می‌کنند، این سیستم را در دو لایه پیاده کرده‌اند: یکی در پردازش اصلی و دیگری در همین زنجیره تفکر.

این یعنی حتی اگر با تکنیک‌های دستکاری فعال‌سازی (Activation Steering) موفق شوید قفل لایه اول را باز کنید، زنجیره تفکر مدل همچنان می‌تواند با بازسازی سیگنال‌های امنیتی، مانع از پاسخ‌دهی شود. این تحقیق نشان می‌دهد که مدل‌های استدلالی جدید مانند DeepSeek-R1 به دلیل همین «استدلال گام‌به‌گام»، در برابر مداخلات سطحی بسیار مقاوم‌تر هستند و برای دور زدن آن‌ها، باید استراتژی‌های پیچیده‌تری را در طراحی «زنجیره تفکر» در نظر گرفت.

این یافته‌ها درک ما از امنیت مدل‌های نسل جدید را یک گام به جلو می‌برد. 🛡️

‌های_استدلالی

منبع: arXiv Machine Learning