🧠 هدایت دقیق‌تر مدل‌های زبانی: کشف تکنیک جدید در کنترل هوش مصنوعی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی تازه به نکته کلیدی در «هدایت فعال‌سازی» (Activation Steering) دست یافته‌اند که می‌تواند کنترل مدل‌های زبانی را متحول کند. تا پیش از این، منبع سیگنال‌های کنترلی در مدل‌ها موضوعی حاشیه‌ای بود، اما این مقاله نشان می‌دهد که انتخاب منبعِ «تراوشات ذهنی» مدل، تا چه حد بر نتیجه نهایی تاثیرگذار است.

نکته جالب اینجاست: بهترین سیگنال‌ها نه از متن‌های آماده، بلکه از حالت‌های «مرز اجرایی» (Execution-boundary) به دست می‌آیند؛ یعنی دقیقاً لحظه‌ای که مدل در حال تصمیم‌گیری برای تولید ادامه پاسخ است. با تکنیک جدیدی به نام «تفریق دنباله» (Tail Subtraction)، حالا می‌توان سیگنال‌های خالص‌تر و دقیق‌تری برای کنترل رفتار مدل‌های هوش مصنوعی ایجاد کرد.

این پیشرفت یعنی در آینده مدل‌ها را بسیار دقیق‌تر از قبل می‌توانیم در مسیر دلخواه هدایت کنیم. 🚀

منبع: arXiv AI