محققان در یک مطالعه تازه، زنگ خطر جدیدی را برای مدلهای زبانی به صدا درآوردهاند. آنها متوجه شدهاند که میتوان با تزریق «زنجیره تفکر» (Chain-of-Thought) مخرب به مدلهای هوش مصنوعی، آنها را مجبور کرد تا رفتارهای ناامن و خطرناکی از خود نشان دهند.
نکات کلیدی این پژوهش:
🔹 این تکنیک میتواند مدلهای زبانی را وادار به پاسخهای مضر (Jailbreak) کند.
🔹 مدلهای مجهز به قابلیت استدلال (Reasoning)، دو برابر بیشتر در معرض این آسیبپذیری هستند.
🔹 سیستمهای محافظتی فعلی مانند Llama-Guard اغلب نمیتوانند این نوع حملات را شناسایی کنند.
این کشف اهمیت بسیار زیادی برای توسعهدهندگان دارد تا در آینده علاوه بر خروجی نهایی مدل، «فرآیند استدلال» آنها را نیز از نظر امنیتی ارزیابی کنند. 🛡️
منبع: arXiv Machine Learning
