🤖 آیا هوش مصنوعی می‌تواند فریب بخورد؟ کشف یک حفره امنیتی جدید!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی تازه کشف کردند که مدل‌های زبانی قدرتمند در برابر دستورات دست‌کاری‌شده، رفتارهای متناقضی نشان می‌دهند. این مطالعه نشان می‌دهد که اگر یک هدف “خطرناک” مستقیماً به مدل داده شود، ممکن است در برابر آن مقاومت کند؛ اما اگر همان دستور توسط واسطه‌های دیگر بازنویسی و غیرمستقیم به مدل منتقل شود، مدل فریب خورده و در جهت خواسته غیرقانونی عمل می‌کند! ⚠️

این یعنی می‌توان با استفاده از یک سیستم چندمرحله‌ای، لایه‌های امنیتی هوش مصنوعی را دور زد و آن را مجبور به اجرای دستورات مخرب کرد، بدون اینکه مدل متوجه ماهیت واقعی درخواست شود. این حفره امنیتی زنگ خطری جدی برای توسعه‌دهندگان سیستم‌های خودکار است که از ایجنت‌های هوشمند در محیط‌های حساس استفاده می‌کنند.

منبع: arXiv AI