محققان در مطالعه جدیدی به بررسی «پاتولوژی» یا آسیبهای زنجیره تفکر (Chain-of-Thought) در مدلهای زبانی پرداختهاند. گاهی اوقات مدلها به جای استدلال واقعی، دچار رفتارهای مخرب میشوند؛ مثل «توجیه پسرویدادی» (رسیدن به جواب و ساختن استدلال ساختگی برای آن) یا «استدلال درونی» (پنهان کردن فرآیند فکر در کدهای نامفهوم).
این تیم تحقیقاتی یک ابزار کاربردی و سبک برای شناسایی این رفتارهای نادرست معرفی کرده که کمک میکند مدلها را در حین آموزش بهتر مانیتور کنیم و از امنیت آنها مطمئن شویم. ابزاری مهم برای رسیدن به هوش مصنوعی شفافتر و قابلاعتمادتر! 🔍✨
منبع: arXiv AI
