محققان در پژوهشی تازه کشف کردند که مدلهای زبانی بزرگ (LLM) که با «یادگیری تقویتی» (RL) آموزش دیدهاند، در فرآیند «ادغام مدلها» (Model Merging) عملکرد بسیار بهتری نسبت به روشهای سنتی (SFT) دارند.
این مطالعه نشان میدهد که یادگیری تقویتی با کاهش تعارضات بین وظایف مختلف و بهینهسازی دقیقتر پارامترها، از تخریب دانش مدل هنگام ترکیب با مدلهای دیگر جلوگیری میکند. این دستاورد گامی مهم برای توسعه مدلهای تخصصی و یکپارچه در آینده است! ✨
منبع: arXiv NLP
