محققان در یک پژوهش جدید، فریمورک «PISmith» را معرفی کردهاند که با استفاده از یادگیری تقویتی (RL)، سیستمهای دفاعی مدلهای زبانی را به چالش میکشد. این ابزار به عنوان یک «Red Teaming» هوشمند عمل میکند تا نقاط ضعف مدلها در برابر حملات تزریق دستور (Prompt Injection) را شناسایی کند.
نکته جالب اینجاست که مدلهای کنونی با وجود داشتن دیوارههای امنیتی، همچنان در برابر حملات تطبیقی بسیار آسیبپذیر هستند. این دستاورد میتواند گام بزرگی برای ساخت ایجنتهای هوش مصنوعیِ امنتر و قابلاطمینانتر باشد. 🤖🔐
منبع: arXiv Machine Learning
