محققان تکنیک نوآورانهای به نام «Overthinking» (بیشازحد فکر کردن) ابداع کردهاند که میتواند مدلهای هوش مصنوعی را مجبور کند تا اطلاعات پنهان یا رفتارهای ناخواستهای که در زمان آموزش یاد گرفتهاند را برملا کنند. 🕵️♂️
در این روش، با تقویت وزنهای استدلالی مدل، سیستم وادار میشود که «بلندتر فکر کند»؛ این کار باعث میشود تا مدلها تا ۱۰ برابر بیشتر از حالت عادی، اسرار یا سوگیریهای پنهان خود را آشکار کنند. این یافته، گامی مهم برای افزایش امنیت و شفافیت مدلهای زبانی بزرگ (LLM) پیش از انتشار عمومی است تا بتوان به لایههای پنهان آنها بهتر دسترسی داشت. 🔐✨
منبع: arXiv AI
