محققان در یک پژوهش جدید، چارچوب نوآورانهای به نام «MAG» (معدنکاری از طریق هندسه فعالسازی) معرفی کردهاند که بدون نیاز به دادههای برچسبدار، به ما کمک میکند بفهمیم مدلهای زبانی (LLM) چطور استدلال میکنند.
با این روش، میتوان ویژگیهای ذهنی مدل را مستقیماً از فعالیتهای درونی آن استخراج کرد. جالبتر اینکه محققان توانستند با استفاده از این تکنیک، رفتارهای مدل را تغییر دهند یا عملکرد آن را در تشخیصهای خاص بهبود ببخشند. این قدم بزرگی برای تبدیل «جعبه سیاه» مدلهای زبانی به سیستمی شفاف و قابل کنترل است. 🧠💡
منبع: arXiv AI
