تیم OpenAI از یک سیستم جدید به نام «GPT-Red» رونمایی کرده که هدفش افزایش ایمنی و مقاومت مدلهای هوش مصنوعی است. این سیستم با استفاده از تکنیک «خود-بازی» (Self-Play)، به صورت خودکار مدلها را به چالش میکشد تا در برابر حملات تزریق پرامپت (Prompt Injection) و رفتارهای غیرایمن، نفوذناپذیرتر شوند.
این یعنی شاهد مدلهایی خواهیم بود که در برابر نفوذ و سواستفاده، بسیار سختجانتر عمل میکنند. قدمی بزرگ برای کاهش ریسکهای امنیتی هوش مصنوعی! 🦾
منبع: OpenAI Blog
