🚀 رمزگشایی از ذهن ترنسفورمرها؛ مدل‌ها چطور سلسله‌مراتب را درک می‌کنند؟ 🧠🤖

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا امروز می‌دانستیم مدل‌های زبانی ترنسفورمر (مثل GPT) در لایه‌های ابتدایی روی ساختارهای جملات و در لایه‌های عمیق‌تر روی مفاهیم پیچیده کار می‌کنند، اما حالا یک پژوهش تازه در arXiv به صورت دقیق و ریاضی ثابت کرده که این معماری‌ها چگونه ساختارهای سلسله‌مراتبی را در دل خود جای می‌دهند.

محققان با استفاده از گرامرهای صوری نشان دادند که مدل‌های ترنسفورمر ظرفیت ساختاری فوق‌العاده‌ای برای کدگذاری قوانین دستوری و حالات انتزاعی در فضاهای برداری دارند. این دستاورد تئوریک، درک ما را از «هوش» این مدل‌ها یک پله بالاتر می‌برد! 🏗️📐

منبع: arXiv Machine Learning