محققان در مقالهای جدید، مفهوم «تفسیرپذیری درونی» (Interior Interpretability) را معرفی کردهاند که به ما کمک میکند بفهمیم مدلهای هوش مصنوعی (بهویژه مدلهای جدولی بر پایه ترنسفورمر) چگونه اطلاعات را در لایههای داخلی خود پردازش میکنند.
این تحقیق با استفاده از تکنیک Attention Rollout، نحوهی انتشار دادهها بین توکنهای ویژگی را بررسی میکند. با این روش، حالا میتوانیم دید عمیقتری نسبت به ساختار تصمیمگیری مدلها داشته باشیم؛ موضوعی که گامی بزرگ برای شفافتر کردن مدلهای «جعبه سیاه» و درک بهتر رفتار آنهاست.
منبع: arXiv AI
