تا حالا دقت کردید که چطور تغییر کوچکی در لحن یا ساختار جمله، نظر یک هوش مصنوعی را در مورد یک موضوع خاص عوض میکند؟ محققان در پژوهش جدیدی به سراغ این معمای جذاب رفتند تا ببینند ساختار زبانی چطور تصمیمگیری مدلهای LLM را دستخوش تغییر میکند.
آنها با استفاده از «ردیابی علّی» (Causal Tracing) متوجه شدند که این نوسانات رفتاری در لایههای میانی و انتهایی مدل رخ میدهد و جالب اینکه حتی با حفظ معنای جمله، مدلها همچنان دچار بیثباتی در مواضع خود میشوند. این یافتهها به ما کمک میکند بفهمیم در «جعبه سیاه» مدلهای زبانی، هنگام پردازش مفاهیم حساس چه میگذرد. 🧠💡
منبع: arXiv NLP
