🛡️ آسیب‌پذیری هوش مصنوعی در گفتگوهای طولانی؛ خطر «سقوط ایمنی»!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله جدیدی به بررسی یک ضعف مهم در مدل‌های زبانی پرداخته‌اند که در حالت تست‌های معمولی (تک‌مرحله‌ای) دیده نمی‌شود. این پژوهش نشان می‌دهد که مدل‌های هوش مصنوعی وقتی درگیر مکالمات طولانی و چندمرحله‌ای می‌شوند، ممکن است به مرور دچار «سقوط ایمنی» شده و از پروتکل‌های اخلاقی خود فاصله بگیرند.

این تیم یک چارچوب جدید به نام STAR معرفی کرده‌اند که به جای تمرکز بر حملات ساده، رفتار مدل را در طول مسیر گفتگو تحلیل می‌کند. نتیجه جالب اینکه؛ مدلی که در ظاهر کاملاً ایمن به نظر می‌رسد، می‌تواند با تغییر نقش‌دهی در طول چت، کنترل خود را از دست بدهد. این موضوع هشداری است برای توسعه‌دهندگانی که به امنیت سیستم‌های خود در تعاملات پیچیده تکیه کرده‌اند. ⚠️

منبع: arXiv AI