آیا ایجنتهای هوش مصنوعی (RAG) که به اسناد مختلف دسترسی دارند، همیشه حقیقت را میگویند؟ یک پژوهش جدید نشان داده که حتی اگر تمام اطلاعات دریافتی توسط ایجنت درست باشند، مهاجمان میتوانند با تغییر در نحوه تاکید، ترتیب جملات و چیدمان مطالب، ذهن مدل را منحرف کنند!
محققان نام این روش خطرناک را «القای برجستگی» گذاشتهاند. این حمله بدون نیاز به تزریق محتوای جعلی و تنها با دستکاری ساختار متن، ایجنت را به مسیر اشتباه میکشاند. خوشبختانه، آنها راهکاری به نام «نرمالسازی برجستگی» معرفی کردهاند که نرخ موفقیت این حملات را بهشدت کاهش میدهد.
امنیت ایجنتهای خودمختار روز به روز اهمیت بیشتری پیدا میکند! 🤖🔒
منبع: arXiv NLP
