یکی از چالشهای بزرگ در آموزش مدلهای زبانی (LLM) با استفاده از یادگیری تقویتی، کاهش تنوع در طول فرآیند آموزش است که باعث میشود مدل، قدرت کاوش خود را از دست بدهد. حالا محققان در پژوهشی جدید، چارچوب نوآورانه ای به نام Thinking Seeds معرفی کردهاند.
این متد با استفاده از چکپوینتهای قدیمی مدل به عنوان «بذرهای فکری»، به جای استفاده از دادههای کلی، در سطح توکنها ترکیب میشود. نتیجه این کار؟ حفظ پایداری آموزش و رسیدن به نتایج بسیار دقیقتر در حل مسائل ریاضی و استدلالی! این دستاورد یک گام بزرگ برای هوشمندتر کردن فرآیند آموزش مدلهای بزرگ است. 💡
منبع: arXiv NLP
