محققان حوزه هوش مصنوعی روش جدیدی به نام ReCo را معرفی کردهاند که میتواند چالشهای رایج در آموزش مدلهای استدلالگر (Reasoning Models) را حل کند.
مدلهای فعلی که از روش GRPO استفاده میکنند، گاهی دچار «تجمع پاسخها» میشوند؛ یعنی مدل فقط روی پاسخهای محتملتر تمرکز کرده و توانایی استدلال خلاقانه را از دست میدهد. ReCo با بازنگری در نحوه وزندهی به پاسخها و اصلاح پارامترهای آموزشی، باعث بهبود چشمگیر عملکرد مدلهایی مثل Qwen2.5 و Llama-3.1 در مسائل پیچیده ریاضی شده است.
این پیشرفت گام مهمی برای رسیدن به هوش مصنوعی با توانایی حل مسئله دقیقتر و عمیقتر است! 🚀
منبع: arXiv AI
