🚀 بهبود چشمگیر آموزش مدل‌های زبانی با روش جدید SIS

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از چالش‌های اصلی در آموزش مدل‌های زبانی با یادگیری تقویتی (RL)، استفاده از داده‌های «خارج از سیاست» (off-policy) است که باعث بروز نوسانات و ناپایداری در آموزش می‌شود. محققان به تازگی روشی به نام SIS (Selective Importance Sampling) معرفی کرده‌اند که مانند یک افزونه عمل می‌کند.

این متد با استفاده از یک آزمون رد و قبولِ هوشمند در سطح توکن، داده‌های off-policy را به داده‌های «روی سیاست» (on-policy) تبدیل می‌کند. نتیجه؟ کاهش قابل توجه واریانس و بهبود پایداری و کیفیت مدل‌های بزرگ زبانی (LLMs) در کارهای محاسباتی و ایجنتیک، بدون آنکه سرعت آموزش را کند کند! یک گام مهم دیگر برای حرفه‌ای‌تر شدن خروجی مدل‌های هوش مصنوعی. 🧠✨

منبع: arXiv AI