🚀 درک عمیق‌تر مدل‌های زبانی با «Persistent SAEs»

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله‌ای جدید، نسل تازه‌ای از Sparse Autoencoders (SAEs) را معرفی کرده‌اند که به مدل‌های زبانی کمک می‌کند ویژگی‌های «پایدار» را در طول زمان درک کنند. 🧠

مدل‌های استاندارد SAE هر توکن را مستقل بررسی می‌کنند، اما این روش جدید با یادگیری ضریب پایداری برای هر ویژگی، اجازه می‌دهد مدل بفهمد کدام اطلاعات باید در حافظه بمانند و کدام‌ها زودگذر هستند. این دستاورد به ویژه برای مانیتورینگ دقیق‌تر مدل‌ها، مثل تشخیص حملات Prompt Injection در مکالمات طولانی، بسیار کاربردی است. ✨

منبع: arXiv Machine Learning