تا حالا فکر کردید چطور امنیت مدلهای زبانی مثل GPT را تضمین میکنند؟ محققان بهتازگی سیستم جدیدی به نام «GPT-Red» را معرفی کردهاند که یک «قرمزتیم» (Red Teaming) خودکار و فوقهوشمند است.
این مدل با استفاده از الگوریتم خود-بازی (Self-Play)، بهطور مداوم به مدلهای دیگر حمله میکند تا نقاط ضعف آنها در برابر تزریق دستورات (Prompt Injection) را پیدا کند. جالب اینجاست که GPT-Red در این کار از انسانها هم پیشی گرفته و میتواند مدلهای قدرتمندی مثل GPT-5.5 را بهراحتی شکست دهد! این یعنی یک چرخه خود-تقویتکننده برای ساخت مدلهای زبانی امنتر و نفوذناپذیرتر در آینده. 🚀
منبع: arXiv AI
