محققان به راهکار جذابی برای افزایش امنیت مدلهای زبانی (LLM) دست یافتهاند! این روش جدید که بر پایه «هندسه» و «رمزگذارهای خودکار پراکنده» (SAE) طراحی شده، به مدلها کمک میکند تا مرزهای ایمنی را به شکلی دقیقتر و با دقت ۹۶ تا ۹۹ درصد شناسایی کنند.
نکته جالب اینجاست که این تحقیق نشان میدهد مرزهای ایمنی در فضای پنهان مدلهای هوش مصنوعی معمولاً در ساختارهای هندسی سادهتری قرار دارند که این موضوع کار را برای بهینهسازی و امنیت سیستمهای هوشمند بسیار سادهتر و دقیقتر میکند. گامی بزرگ برای رسیدن به مدلهای زبانی قابلاطمینانتر! 🚀
منبع: arXiv AI
