یک تحقیق علمی جدید نشان میدهد که مدلهای زبانی (LLMs) اغلب قبل از اینکه فرآیند «زنجیره تفکر» یا همان CoT را شروع کنند، پاسخ نهایی را در لایههای پنهان خود آماده کردهاند!
در واقع، این «استدلال گامبهگام» که ما فکر میکنیم هوش مصنوعی در حین تولید متن انجام میدهد، گاهی نوعی توجیهِ «پسرویدادی» (Post-hoc) برای تصمیمی است که قبلاً گرفته شده. محققان متوجه شدند با دستکاری فعالیتهای عصبی مدل قبل از شروع استدلال، میتوانند پاسخ نهایی را تغییر دهند که این موضوع هشداری برای محققان حوزه ایمنی و تفسیرپذیری (Interpretability) هوش مصنوعی است.
نتیجهگیری مهم: مدلها ممکن است برای رسیدن به یک باور غلط، به ساختن استدلالهای ساختگی (Confabulation) روی بیاورند که این چالش بزرگی برای اعتماد به هوش مصنوعی است.
منبع: arXiv AI
