تا به حال برایتان سوال شده که داخل مدلهای زبانی (Transformers) دقیقاً چه میگذرد و کدام لایهها تصمیم نهایی را میگیرند؟ محققان در مقالهای جدید، متد جدیدی به نام «Unpack» را معرفی کردهاند که بدون نیاز به آموزش اضافه یا گرادیانهای پیچیده، به ما اجازه میدهد «مسیر پردازش» یک مدل را کالبدشکافی کنیم.
با این روش، میتوانیم دقیقاً ببینیم هر توکن چگونه در لایههای مختلف پردازش شده و چه تعاملی بین بخشهای مختلف شبکه ایجاد شده است. این دستاورد گام بزرگی برای «تفسیرپذیری مکانیکی» (Mechanistic Interpretability) است تا بفهمیم مدلها چطور فکر میکنند! 🚀
منبع: arXiv AI
