تا امروز میدانستیم مدلهای زبانی ترنسفورمر (مثل GPT) در لایههای ابتدایی روی ساختارهای جملات و در لایههای عمیقتر روی مفاهیم پیچیده کار میکنند، اما حالا یک پژوهش تازه در arXiv به صورت دقیق و ریاضی ثابت کرده که این معماریها چگونه ساختارهای سلسلهمراتبی را در دل خود جای میدهند.
محققان با استفاده از گرامرهای صوری نشان دادند که مدلهای ترنسفورمر ظرفیت ساختاری فوقالعادهای برای کدگذاری قوانین دستوری و حالات انتزاعی در فضاهای برداری دارند. این دستاورد تئوریک، درک ما را از «هوش» این مدلها یک پله بالاتر میبرد! 🏗️📐
منبع: arXiv Machine Learning
