محققان در پژوهشی جدید به سراغ موضوعی حساس و مهم در امنیت هوش مصنوعی رفتهاند: «استگانوگرافی» یا پنهاننگاری در مدلهای زبانی (LLMs). این تحقیق بررسی میکند که آیا مدلها میتوانند زنجیره تفکر (CoT) خود را در متون عادی پنهان کنند تا از نظارتهای امنیتی ما فرار کنند؟
نکته امیدوارکننده اینجاست که مدلهای پیشرو فعلی هنوز در انجام همزمانِ «استدلال» و «پنهانسازی» آن در قالب یک متن عادی ناتوان هستند. این یافتهها برای توسعهدهندگان حیاتی است تا بتوانند سیاستهای امنیتی بهتری برای جلوگیری از رفتارهای غیرمنتظره مدلهای هوشمند تدوین کنند. دنیای امنیت AI هر روز پیچیدهتر میشود! 🧠🔒
منبع: arXiv AI
