🔍 آیا ویژگی‌های استخراج شده توسط SAEها واقعاً در عملکرد مدل نقش دارند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

در دنیای تفسیرپذیری مدل‌های زبانی (Interpretability)، استفاده از «Sparse Autoencoders» یا همان SAEها برای درک بهتر نحوه تصمیم‌گیری مدل‌ها بسیار رایج است. اما یک مقاله جدید در arXiv به این چالش پرداخته که آیا این ویژگی‌ها واقعاً علت اصلی خروجی مدل هستند یا خیر.

نکات کلیدی این پژوهش:
🔹 محققان با بررسی ۳.۹ میلیون ویژگی در مدل‌های مختلف، متوجه شدند که ویژگی‌های تک‌توکنی (Single-token) به شدت در لایه‌های ابتدایی مدل متمرکز هستند.
🔹 تفاوت‌های علّی بین خانواده‌های مختلف SAE (مثل GemmaScope در مقابل LlamaScope) بسیار بیشتر از آن چیزی است که فکر می‌کردیم؛ این یعنی تفسیرپذیری به شدت به «روش آموزش» خودِ مدل بستگی دارد نه فقط معماری آن.
🔹 این نتایج نشان می‌دهد که ادعاهای ما درباره نحوه کارکرد مدل‌ها می‌تواند بسته به نحوه آموزش آن‌ها تغییر کند.

این تحقیق نشان می‌دهد مسیر ما برای دستیابی به «شفافیت کامل» در هوش مصنوعی همچنان پر از پیچیدگی‌های فنی است که باید بیشتر به آن‌ها توجه کنیم. 🧠✨

منبع: arXiv Machine Learning