محققان به تازگی در مقالهای جدید نشان دادند که چگونه میتوان با استفاده از یک چارچوب نوآورانه به نام «Concept2Scenario»، آسیبپذیریهای مدلهای هوش مصنوعی را شناسایی کرد.
نکته کلیدی اینجاست: مدلهای زبانی بزرگ (LLM) علیرغم آموزشهای ایمنی، در برخی «سناریوهای خاص» ضعیف عمل میکنند و گارد محافظتی خود را پایین میآورند. این تحقیق با استفاده از رمزگذارها (Sparse Autoencoders) توانسته این سناریوهای خطرناک را کشف کند که منجر به افزایش چشمگیر نرخ موفقیت حملات تست نفوذ (Red-teaming) شده است. این یافتهها نشان میدهد که حتی مدلهای قدرتمندی مثل GPT-5 یا Claude نیز در برابر این روشهای مبتنی بر سناریو آسیبپذیر هستند.
این تحقیق گامی مهم برای درک بهتر مکانیسمهای درونی مدلها و بهبود ایمنی هوش مصنوعی در آینده است. 🤖🔒
منبع: arXiv AI
