محققان در یک پژوهش جذاب، مکانیسم «توجه» (Attention) در مدلهای ترنسفورمر را با استفاده از «نظریه گروه بازبهنجارش» (Renormalization Group) کالبدشکافی کردهاند. این مطالعه نشان میدهد که چگونه توجه، شکافِ عملکرد مدلهای MLP را در تحلیل دادههای پیچیده و طولانی پر میکند. 🧠✨
نکات کلیدی این دستاورد علمی:
✅ کشف نقش حیاتی توجه در انتقال فاز در فضای بازنمایی دادهها.
✅ اثبات این موضوع که لایه اول (L0H0) بیشترین تأثیر را در تغییرات بازنمایی مدل دارد.
✅ درک عمیقتر از چرایی برتری ترنسفورمرها در پردازش الگوهای بلندمدت نسبت به معماریهای سادهتر.
این تحقیق گام بزرگی برای درک بهترِ «جعبه سیاه» مدلهای هوش مصنوعی و بهینهسازی دقیقتر معماری ترنسفورمرهاست. 🚀
منبع: arXiv Machine Learning
