محققان در مقالهای تازه، راهکار هوشمندانهای برای درک بهتر «مکانیسمهای درونی» مدلهای زبانی بزرگ ارائه کردهاند. مسئله اینجاست که در مدلهای فعلی، ویژگیهای زبانی با هم درهمتنیده هستند که باعث میشود تغییر دادن یک مفهوم، ناخواسته باعث تغییر مفاهیم دیگر شود.
این تیم پژوهشی با استفاده از اصل «مکانیسمهای مستقل علی»، پیشنهاد دادهاند که ویژگیهای درونی مدلها به گونهای تنظیم شوند که «تقریباً متعامد» (Almost Orthogonal) باشند. نتیجه؟ مداخلات ما در مدل بسیار دقیقتر و قابلکنترلتر میشود، بدون اینکه عملکرد اصلی مدل افت کند.
این تحقیق گامی بزرگ برای رسیدن به مدلهای شفافتر (Interpretability) است که در آن میتوانیم دقیقاً بفهمیم چرا هوش مصنوعی یک تصمیم خاص میگیرد.
🔗 لینک مقاله و کد:
https://github.com/mrtzmllr/sae-icm
منبع: arXiv Machine Learning
