محققان در مقاله جدیدی روشی خطرناک به نام «DisarmRAG» را معرفی کردهاند که امنیت مدلهای زبانی (LLMs) در سیستمهای RAG را به چالش میکشد. برخلاف حملات سنتی که فقط پایگاه دانش را مسموم میکردند، این روش با نفوذ به بخش «بازیاب» (Retriever)، توانایی خوداصلاحی مدل را غیرفعال کرده و آن را مجبور میکند خروجیهای مدنظر مهاجم را تولید کند.
این تحقیق هشدار میدهد که شکاف بزرگی بین محیطهای آزمایشگاهی و کاربردهای واقعی وجود دارد و سیستمهای هوش مصنوعی هنوز در برابر حملات تزریق دستورات (Prompt Injection) بسیار آسیبپذیر هستند.
منبع: arXiv NLP
