🛡️ آسیب‌پذیری جدید در سیستم‌های هوش مصنوعی چندعامله: هشدار امنیتی برای مدل‌های بزرگ!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در یک پژوهش جدید، تهدید امنیتی مهمی به نام «PlanFlip» را شناسایی کرده‌اند که سیستم‌های LLM چندعامله (Multi-Agent) را هدف قرار می‌دهد. در این سیستم‌ها، یک «برنامه‌ریز» (Planner) وظایف را تقسیم می‌کند، اما حالا مشخص شده که یک تزریق دستور (Prompt Injection) ساده به این بخش می‌تواند کل فرآیند اجرایی را منحرف کند.

نتایج این تحقیق نکات جالبی دارد:
۱. مدل‌های قدرتمندتر مثل GPT-5 بیشتر در معرض خطر هستند!
۲. سیستم‌های همگن (که از یک مدل واحد برای بخش‌های مختلف استفاده می‌کنند) دارای یک «نقطه کور» بزرگ هستند که باعث می‌شود حملات از دید ناظر پنهان بماند.
۳. مدل‌های مبتنی بر استدلال (مانند DeepSeek-R1) مقاومت بسیار بالاتری در برابر این نوع حملات نشان داده‌اند.

این یافته‌ها نشان می‌دهد که امنیت در معماری‌های پیچیده هوش مصنوعی، فراتر از امنیت تک‌مدل‌هاست و نیاز به مکانیزم‌های دفاعی جدید مانند «GoalAnchorCheck» داریم. 🤖🔐

منبع: arXiv AI