محققان در یک پژوهش علمی جدید، به کالبدشکافی «جهتِ حقیقت» (Truth Direction) در مدلهای زبانی کوچک پرداختهاند. این مطالعه نشان میدهد که دانشِ مدلها در فضای پنهانِ آنها به شکلی هندسی و ساختاریافته ذخیره میشود و حتی میتوان بدون نیاز به برچسبهای کمکی، جهتگیری مدل نسبت به درستی یک گزاره را شناسایی کرد.
این یافتهها نه تنها درک ما از نحوه پردازش اطلاعات توسط مدلهای زبانی را بهبود میبخشد، بلکه گامی بزرگ برای ساخت مدلهای شفافتر و قابلاعتمادتر است. 🧠💡
منبع: arXiv Machine Learning
