محققان روشی نوآورانه به نام W2SPO معرفی کردهاند که یادگیری تقویتشده (RL) در مدلهای زبانی بزرگ را متحول میکند! 🧠
در مدلهای فعلی، وقتی هوش مصنوعی در حال یادگیریِ حل مسائل پیچیده (مانند ریاضی) است، اغلب در مسیرهای اشتباه تکراری گیر میکند. روش جدید W2SPO با استفاده از یک «مدل کمکی» سبک و تزریق تنها ۸ توکنِ هوشمند به مسیر استدلال مدل اصلی، به آن کمک میکند تا مسیر درست را سریعتر پیدا کند.
نتایج این تحقیق خیرهکننده است:
✅ بهبود دقت در پاسخدهی (Pass@1)
✅ افزایش ۳.۵ برابری سرعت آموزش نسبت به متدهای رایج مثل GRPO
این یعنی هوش مصنوعی در آینده میتواند با هزینه محاسباتی کمتر، بسیار باهوشتر عمل کند. 📈
منبع: arXiv AI
