محققان در یک پژوهش جدید، تهدید امنیتی مهمی به نام «PlanFlip» را شناسایی کردهاند که سیستمهای LLM چندعامله (Multi-Agent) را هدف قرار میدهد. در این سیستمها، یک «برنامهریز» (Planner) وظایف را تقسیم میکند، اما حالا مشخص شده که یک تزریق دستور (Prompt Injection) ساده به این بخش میتواند کل فرآیند اجرایی را منحرف کند.
نتایج این تحقیق نکات جالبی دارد:
۱. مدلهای قدرتمندتر مثل GPT-5 بیشتر در معرض خطر هستند!
۲. سیستمهای همگن (که از یک مدل واحد برای بخشهای مختلف استفاده میکنند) دارای یک «نقطه کور» بزرگ هستند که باعث میشود حملات از دید ناظر پنهان بماند.
۳. مدلهای مبتنی بر استدلال (مانند DeepSeek-R1) مقاومت بسیار بالاتری در برابر این نوع حملات نشان دادهاند.
این یافتهها نشان میدهد که امنیت در معماریهای پیچیده هوش مصنوعی، فراتر از امنیت تکمدلهاست و نیاز به مکانیزمهای دفاعی جدید مانند «GoalAnchorCheck» داریم. 🤖🔐
منبع: arXiv AI
