محققان در یک پژوهش تازه به بررسی عمیق ساختار داخلی مدلهای زبانی بزرگ (LLM) پرداختهاند تا ببینند «شخصیتها»، «ارزشها» و «عقاید» دقیقاً در کجای فضای پردازشی این مدلها ذخیره میشوند.
نتایج این مطالعه نشان میدهد که مدلها شخصیتها را در لایههای نهاییِ خود کدگذاری میکنند. نکته جالب اینکه دیدگاههای سیاسی مثل لیبرالیسم و محافظهکاری در مناطق مجزایی از حافظه مدل جای میگیرند، در حالی که مفاهیم اخلاقی همپوشانی بیشتری با هم دارند. این دستاورد به ما کمک میکند تا در آینده کنترل دقیقتری روی رفتار و خروجیهای مدلهای هوش مصنوعی داشته باشیم.
منبع: arXiv AI
