مدلهای زبانی بزرگ (LRMs) در حال حاضر به صورت خودکار روشهای استدلال خود را انتخاب میکنند که گاهی اوقات باعث بروز خطا یا ناکارآمدی میشود. محققان به تازگی روش جدیدی به نام «SAE-Steering» ابداع کردهاند که به ما اجازه میدهد «فرمان» استدلال مدل را در دست بگیریم!
با استفاده از «خودرمزگذارهای تنک» (Sparse Autoencoders)، این روش میتواند ویژگیهای پیچیده و درهمتنیده در لایههای مدل را تفکیک کرده و استراتژیهای استدلال را به شکلی دقیق کنترل کند. نتیجه؟ بیش از ۱۵ درصد بهبود در کنترلپذیری و ۷ درصد افزایش دقت در حل مسائل پیچیده. این یعنی هوش مصنوعی حالا میتواند قبل از رسیدن به پاسخ غلط، مسیر فکری خود را اصلاح کند! 🚀
منبع: arXiv AI
