آیا تا به حال فکر کردهاید چرا مدلهای زبانی بزرگ (LLM) رفتارهای شگفتانگیزی از خود نشان میدهند؟ محققان در مقالهای جدید با استفاده از «نظریه میدان شناختی» (Cognitive Field Theory) بررسی کردهاند که چگونه یادگیری در طول آموزش، پویاییِ جمعیِ مدلهای ترنسفورمر را سازماندهی میکند. 🧠
این مطالعه نشان میدهد که چگونه مدلها با تجمعِ حالتهای آرامسازی (relaxation modes) در طول زمان، حافظه خود را تقویت کرده و به یک وضعیت تعادلیِ بهینه میرسند. در واقع، این پژوهش گامی بزرگ برای درکِ عمیقتر از «فیزیکِ حاکم» بر هوش مصنوعی است که به ما کمک میکند بفهمیم ترنسفورمرها در زیرِ لایههای عددی خود، چطور مفاهیم را سازماندهی میکنند. 📊✨
منبع: arXiv Machine Learning
