محققان در پژوهشی تازه به نکته کلیدی در «هدایت فعالسازی» (Activation Steering) دست یافتهاند که میتواند کنترل مدلهای زبانی را متحول کند. تا پیش از این، منبع سیگنالهای کنترلی در مدلها موضوعی حاشیهای بود، اما این مقاله نشان میدهد که انتخاب منبعِ «تراوشات ذهنی» مدل، تا چه حد بر نتیجه نهایی تاثیرگذار است.
نکته جالب اینجاست: بهترین سیگنالها نه از متنهای آماده، بلکه از حالتهای «مرز اجرایی» (Execution-boundary) به دست میآیند؛ یعنی دقیقاً لحظهای که مدل در حال تصمیمگیری برای تولید ادامه پاسخ است. با تکنیک جدیدی به نام «تفریق دنباله» (Tail Subtraction)، حالا میتوان سیگنالهای خالصتر و دقیقتری برای کنترل رفتار مدلهای هوش مصنوعی ایجاد کرد.
این پیشرفت یعنی در آینده مدلها را بسیار دقیقتر از قبل میتوانیم در مسیر دلخواه هدایت کنیم. 🚀
منبع: arXiv AI
