محققان در یک پژوهش جدید و بسیار جذاب، پرده از راز «یادگیری درونمتنی» (In-Context Learning) در مدلهای زبانی بزرگ برداشتهاند! 🔍
این مقاله نشان میدهد که نحوه یادگیری مدلهای LLM هنگام دریافت نمونهها، شباهت عجیبی به «بهینهسازی گرادیان سیاست» (Policy Gradient) در یادگیری تقویتی دارد. در واقع، مکانیزم توجه (Attention) در ترنسفورمرها به گونهای عمل میکند که خروجیها را به سمت پاسخهای باکیفیتتر سوق میدهد. این تحلیل ریاضی، دیدگاه جدیدی درباره چگونگی بهبود عملکرد مدلها بدون نیاز به آموزش مجدد (Fine-tuning) به ما میدهد. 🚀
اگر به مباحث نظری و زیربناییِ هوش مصنوعی علاقه دارید، این مطالعه برای درک بهترِ دنیای مدلهای زبانی فوقالعاده است! 📝
منبع: arXiv Machine Learning
