محققان روش نوآورانهای به نام «H²SD» (مخفف Hybrid Hindsight Self-Distillation) معرفی کردهاند که میتواند دقت استدلال در مدلهای زبانی (LLMs) را بهطور چشمگیری افزایش دهد.
این چارچوب جدید، برخلاف روشهای قدیمی که یادگیری را تنها بر اساس نتیجه نهایی انجام میدادند، با استفاده از یک رویکرد هوشمندانه و ترکیبی، از اطلاعات مدل معلم برای اصلاح مسیر یادگیری در حین پاسخدهی استفاده میکند. در واقع، این مدل میداند در کجا اشتباه کرده و چگونه با خود-تقطیری (Self-Distillation) دقیقتر عمل کند. 🧠💡
این تکنولوژی بهویژه در حل مسائل پیچیده ریاضی و تولید کدهای برنامهنویسی کاربرد بسیاری دارد و میتواند مدلها را در مسیر استدلالهای منطقی، بسیار دقیقتر و قابلاعتمادتر کند.
منبع: arXiv Machine Learning
