🚨 تهدید جدید در دنیای هوش مصنوعی: فرار از سد امنیتی با «زنجیره تفکر» (CoT) مخرب!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک مطالعه تازه، زنگ خطر جدیدی را برای مدل‌های زبانی به صدا درآورده‌اند. آن‌ها متوجه شده‌اند که می‌توان با تزریق «زنجیره تفکر» (Chain-of-Thought) مخرب به مدل‌های هوش مصنوعی، آن‌ها را مجبور کرد تا رفتارهای ناامن و خطرناکی از خود نشان دهند.

نکات کلیدی این پژوهش:
🔹 این تکنیک می‌تواند مدل‌های زبانی را وادار به پاسخ‌های مضر (Jailbreak) کند.
🔹 مدل‌های مجهز به قابلیت استدلال (Reasoning)، دو برابر بیشتر در معرض این آسیب‌پذیری هستند.
🔹 سیستم‌های محافظتی فعلی مانند Llama-Guard اغلب نمی‌توانند این نوع حملات را شناسایی کنند.

این کشف اهمیت بسیار زیادی برای توسعه‌دهندگان دارد تا در آینده علاوه بر خروجی نهایی مدل، «فرآیند استدلال» آن‌ها را نیز از نظر امنیتی ارزیابی کنند. 🛡️

منبع: arXiv Machine Learning