🛡 تهدید جدید برای ایجنت‌های هوشمند: حمله از طریق «القای برجستگی» (Salience Induction)

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا ایجنت‌های هوش مصنوعی (RAG) که به اسناد مختلف دسترسی دارند، همیشه حقیقت را می‌گویند؟ یک پژوهش جدید نشان داده که حتی اگر تمام اطلاعات دریافتی توسط ایجنت درست باشند، مهاجمان می‌توانند با تغییر در نحوه تاکید، ترتیب جملات و چیدمان مطالب، ذهن مدل را منحرف کنند!

محققان نام این روش خطرناک را «القای برجستگی» گذاشته‌اند. این حمله بدون نیاز به تزریق محتوای جعلی و تنها با دستکاری ساختار متن، ایجنت را به مسیر اشتباه می‌کشاند. خوشبختانه، آن‌ها راهکاری به نام «نرمال‌سازی برجستگی» معرفی کرده‌اند که نرخ موفقیت این حملات را به‌شدت کاهش می‌دهد.

امنیت ایجنت‌های خودمختار روز به روز اهمیت بیشتری پیدا می‌کند! 🤖🔒

منبع: arXiv NLP