محققان در مقالهای جدید به سراغ یک چالش جدی رفتهاند: چطور میتوان با استفاده از «کامنتهای خصمانه»، ایجنتهای هوشمند را وادار کرد تا آسیبپذیریهای مدلهای زبانی (LLM) را نادیده بگیرند یا آنها را دور بزنند؟
این تحقیق نشان میدهد که چگونه سیستمهای تشخیص آسیبپذیری خود میتوانند هدف «حملات ایجنتی» قرار بگیرند که این موضوع زنگ خطری برای امنیت مدلهای آینده است. دنیای امنیت هوش مصنوعی روز به روز پیچیدهتر میشود!
🔗 جزئیات فنی این پژوهش را اینجا بخوانید
منبع: Hacker News LLM
