محققان در پژوهش جدیدی به یافتهای جالب رسیدهاند: ایجنتهای هوش مصنوعی هنگام مسمومسازی حافظه (Memory Poisoning)، یک الگوی رفتاری خاص از خود نشان میدهند. این تحقیق نشان میدهد که میتوان با بررسی توالی فراخوانی ابزارها (مثلاً زمان بازخوانی حافظه قبل از ارسال ایمیل)، حملات سایبری علیه مدلهای زبانی را با دقت بسیار بالا شناسایی کرد.
نکته کلیدی اینجاست که این «امضای رفتاری»، حتی در مدلهای بزرگی مثل GPT-4o هم دیده میشود. اگرچه هنوز چالشهایی مثل نرخ مثبت کاذب در استفادههای عادی وجود دارد، اما این روش گام بزرگی برای امنیتِ ایجنتهای خودمختار و جلوگیری از نفوذ است. 🛡️
منبع: arXiv Machine Learning
