محققان در یک مطالعه پیشگامانه، الگوریتم هوشمندی به نام Self-RedTeam را معرفی کردهاند که دنیای امنیت مدلهای زبانی (LLM) را متحول میکند.
این الگوریتم با استفاده از روش «بازی خودکار» (Self-Play)، مدل را همزمان در نقش مهاجم و مدافع قرار میدهد. در واقع، هوش مصنوعی خودش به خودش حمله میکند تا نقاط ضعفش را پیدا کرده و یاد بگیرد چطور در برابر حملات احتمالی کاربران غیرمجاز، پاسخهای ایمنتری ارائه دهد.
نتایج آزمایشها نشان میدهد که این روش نه تنها آسیبپذیری مدلها را تا ۹۵ درصد کاهش میدهد، بلکه راهکار بسیار موثرتری نسبت به روشهای سنتی (که فقط پس از وقوع حمله به دنبال وصله کردن سیستم بودند) ارائه میدهد.
این یعنی هوش مصنوعی در آیندهای نزدیک، بهصورت خودکار و مداوم برای امنتر شدن در حال تمرین است! 🚀
منبع: arXiv Machine Learning
