محققان در یک پژوهش جدید، راهکاری نوآورانه برای بهبود فرآیند Fine-tuning مدلهای زبانی ارائه دادهاند. این مطالعه نشان میدهد که برخلاف تصور رایج، شکست مدلها در استفاده از جمعیتهای کوچک (Small Population) در استراتژیهای تکاملی (ES)، لزوماً به محدودیتهای ذاتی مربوط نیست؛ بلکه اغلب ناشی از نحوه طراحی و نرمالسازی پاداشها (Reward) است.
با اصلاح این رویکرد، محققان توانستند دقت مدلها را در بنچمارکهای دشواری مثل GSM8K بهطرز چشمگیری افزایش دهند. این دستاورد میتواند راه را برای آموزش بهینهتر و کمهزینهتر مدلهای هوش مصنوعی هموار کند. 🧠💡
منبع: arXiv Machine Learning
