🚀 بهبود چشمگیر مدل‌های زبانی با متد جدید W2SPO

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان روشی نوآورانه به نام W2SPO معرفی کرده‌اند که یادگیری تقویت‌شده (RL) در مدل‌های زبانی بزرگ را متحول می‌کند! 🧠

در مدل‌های فعلی، وقتی هوش مصنوعی در حال یادگیریِ حل مسائل پیچیده (مانند ریاضی) است، اغلب در مسیرهای اشتباه تکراری گیر می‌کند. روش جدید W2SPO با استفاده از یک «مدل کمکی» سبک و تزریق تنها ۸ توکنِ هوشمند به مسیر استدلال مدل اصلی، به آن کمک می‌کند تا مسیر درست را سریع‌تر پیدا کند.

نتایج این تحقیق خیره‌کننده است:
✅ بهبود دقت در پاسخ‌دهی (Pass@1)
✅ افزایش ۳.۵ برابری سرعت آموزش نسبت به متدهای رایج مثل GRPO

این یعنی هوش مصنوعی در آینده می‌تواند با هزینه محاسباتی کمتر، بسیار باهوش‌تر عمل کند. 📈

منبع: arXiv AI