🧠 کنترل هوشمندانه استدلال مدل‌های زبانی با تکنیک SAE-Steering

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های زبانی بزرگ (LRMs) در حال حاضر به صورت خودکار روش‌های استدلال خود را انتخاب می‌کنند که گاهی اوقات باعث بروز خطا یا ناکارآمدی می‌شود. محققان به تازگی روش جدیدی به نام «SAE-Steering» ابداع کرده‌اند که به ما اجازه می‌دهد «فرمان» استدلال مدل را در دست بگیریم!

با استفاده از «خودرمزگذار‌های تنک» (Sparse Autoencoders)، این روش می‌تواند ویژگی‌های پیچیده و درهم‌تنیده در لایه‌های مدل را تفکیک کرده و استراتژی‌های استدلال را به شکلی دقیق کنترل کند. نتیجه؟ بیش از ۱۵ درصد بهبود در کنترل‌پذیری و ۷ درصد افزایش دقت در حل مسائل پیچیده. این یعنی هوش مصنوعی حالا می‌تواند قبل از رسیدن به پاسخ غلط، مسیر فکری خود را اصلاح کند! 🚀

منبع: arXiv AI