یکی از چالشهای اصلی در آموزش مدلهای زبانی با یادگیری تقویتی (RL)، استفاده از دادههای «خارج از سیاست» (off-policy) است که باعث بروز نوسانات و ناپایداری در آموزش میشود. محققان به تازگی روشی به نام SIS (Selective Importance Sampling) معرفی کردهاند که مانند یک افزونه عمل میکند.
این متد با استفاده از یک آزمون رد و قبولِ هوشمند در سطح توکن، دادههای off-policy را به دادههای «روی سیاست» (on-policy) تبدیل میکند. نتیجه؟ کاهش قابل توجه واریانس و بهبود پایداری و کیفیت مدلهای بزرگ زبانی (LLMs) در کارهای محاسباتی و ایجنتیک، بدون آنکه سرعت آموزش را کند کند! یک گام مهم دیگر برای حرفهایتر شدن خروجی مدلهای هوش مصنوعی. 🧠✨
منبع: arXiv AI
