محققان در یک دستاورد علمی جدید، چارچوب ریاضی تازهای را برای درک عملکرد مدلهای زبانی بزرگ (Transformer) معرفی کردهاند. این پژوهش، عملیات پیچیده مدلهایی مثل LLaMA و Qwen را به زبان «هندسه دیفرانسیل» و «ترمودینامیک» ترجمه میکند.
این مدل جدید نشان میدهد که چگونه اجزای اصلی ترنسفورمرها (مثل Attention و Softmax) در واقع از اصول هندسی و فیزیکی پیروی میکنند. این نگاه تحلیلی نهتنها به درک دقیقتر رفتارهای مدل کمک میکند، بلکه راه را برای بهینهسازیهای فوقدقیق در معماریهای آینده هموار میکند. 🧠✨
منبع: arXiv Machine Learning
