در دنیای هوش مصنوعی، همیشه بحث بر سر این بوده که آیا مدلهای زبانی (LLM) مفاهیم انتزاعی مثل «حقیقت» را به صورت یک جهتگیری (Direction) در فضای برداری خود ذخیره میکنند یا خیر. مقاله جدید «Truth is not a direction» با نگاهی فنی و با استفاده از تحلیلهای منطق «تارسکایی» (Tarski attack)، این فرضیه رایج را به چالش میکشد.
این پژوهش نشان میدهد که دستکاریِ «بردار حقیقت» در مدلها، برخلاف تصور بسیاری، لزوماً به معنای درک حقیقت نیست و بیشتر شبیه به نوعی خطای سیستماتیک است. اگر به مباحث عمیقِ تفسیرپذیری (Interpretability) و زیربنای منطقی مدلهای زبانی علاقه دارید، مطالعه این بحث فنی در Hacker News پیشنهاد میشود! 🧠💻
منبع: Hacker News LLM