محققان در مقالهای جدید، نسل تازهای از Sparse Autoencoders (SAEs) را معرفی کردهاند که به مدلهای زبانی کمک میکند ویژگیهای «پایدار» را در طول زمان درک کنند. 🧠
مدلهای استاندارد SAE هر توکن را مستقل بررسی میکنند، اما این روش جدید با یادگیری ضریب پایداری برای هر ویژگی، اجازه میدهد مدل بفهمد کدام اطلاعات باید در حافظه بمانند و کدامها زودگذر هستند. این دستاورد به ویژه برای مانیتورینگ دقیقتر مدلها، مثل تشخیص حملات Prompt Injection در مکالمات طولانی، بسیار کاربردی است. ✨
منبع: arXiv Machine Learning
