🔍 رمزگشایی از «جعبه سیاه» ترنسفورمرها؛ ابزار جدید Unpack! 🧠💡

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا به حال برایتان سوال شده که داخل مدل‌های زبانی (Transformers) دقیقاً چه می‌گذرد و کدام لایه‌ها تصمیم نهایی را می‌گیرند؟ محققان در مقاله‌ای جدید، متد جدیدی به نام «Unpack» را معرفی کرده‌اند که بدون نیاز به آموزش اضافه یا گرادیان‌های پیچیده، به ما اجازه می‌دهد «مسیر پردازش» یک مدل را کالبدشکافی کنیم.

با این روش، می‌توانیم دقیقاً ببینیم هر توکن چگونه در لایه‌های مختلف پردازش شده و چه تعاملی بین بخش‌های مختلف شبکه ایجاد شده است. این دستاورد گام بزرگی برای «تفسیرپذیری مکانیکی» (Mechanistic Interpretability) است تا بفهمیم مدل‌ها چطور فکر می‌کنند! 🚀

منبع: arXiv AI