آیا تا به حال فکر کردهاید که مدلهای هوش مصنوعی چطور فکر میکنند؟ پژوهشگران در مطالعهای جدید به چالش تفسیر ویژگیهای «رمزگذار تنک» (Sparse Autoencoder) پرداختند. این تحقیق نشان میدهد که بسیاری از برچسبهایی که ما به ویژگیهای مدلهای بزرگ (مثل Qwen یا Llama) میزنیم، در واقع فقط یک «رژیم فعالسازی» را نشان میدهند و لزوماً به معنای یک محور علت و معلولی واقعی نیستند.
این یافتهها به ما کمک میکند تا درک دقیقتری از نحوه کارکرد مدلهای زبانی داشته باشیم و بتوانیم هوش مصنوعی را به شکلی ایمنتر و شفافتر توسعه دهیم. گامی مهم برای درک واقعیِ آنچه درون مدلهای هوشمند میگذرد! 🧠✨
منبع: arXiv Machine Learning
