محققان در یک پژوهش جدید و بسیار جذاب، پرده از عملکرد داخلی مدلهای زبانی (Transformers) برداشتهاند. تا پیش از این، «هدهای القایی» (Induction Heads) را عامل اصلی یادگیریِ درونمتنی (In-context learning) میدانستیم، اما حالا میدانیم که این مدلها فراتر از شمارش ساده عمل میکنند.
این مطالعه نشان میدهد که ترنسفورمرها در واقع از تکنیکهای کلاسیک آماری برای «صافسازی» (Smoothing) دادهها استفاده میکنند و به نوعی یک میانگیری هوشمندانه بین توالیها انجام میدهند. به زبان ساده: مدلهای زبانی یاد میگیرند که چگونه احتمالات را به شکلی بهینه و مشابه مدلهای آماری پیشرفته تنظیم کنند تا خروجی دقیقتری داشته باشند.
این کشف، درک ما از «تفسیرپذیری مکانیکی» مدلهای هوش مصنوعی را یک گام بزرگ به جلو برده است. 🚀
منبع: arXiv Machine Learning
