🚀 راهکار جدید برای حل مشکل «فراموشی» در یادگیری تقویتی مدل‌های زبانی! 🤖

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از چالش‌های بزرگ در آموزش مدل‌های زبانی (LLM) با استفاده از یادگیری تقویتی، کاهش تنوع در طول فرآیند آموزش است که باعث می‌شود مدل، قدرت کاوش خود را از دست بدهد. حالا محققان در پژوهشی جدید، چارچوب نوآورانه ای به نام Thinking Seeds معرفی کرده‌اند.

این متد با استفاده از چک‌پوینت‌های قدیمی مدل به عنوان «بذرهای فکری»، به جای استفاده از داده‌های کلی، در سطح توکن‌ها ترکیب می‌شود. نتیجه این کار؟ حفظ پایداری آموزش و رسیدن به نتایج بسیار دقیق‌تر در حل مسائل ریاضی و استدلالی! این دستاورد یک گام بزرگ برای هوشمندتر کردن فرآیند آموزش مدل‌های بزرگ است. 💡

منبع: arXiv NLP