🧠 بهبود یادگیری مدل‌های زبانی با روش جدید ReCo

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان حوزه هوش مصنوعی روش جدیدی به نام ReCo را معرفی کرده‌اند که می‌تواند چالش‌های رایج در آموزش مدل‌های استدلال‌گر (Reasoning Models) را حل کند.

مدل‌های فعلی که از روش GRPO استفاده می‌کنند، گاهی دچار «تجمع پاسخ‌ها» می‌شوند؛ یعنی مدل فقط روی پاسخ‌های محتمل‌تر تمرکز کرده و توانایی استدلال خلاقانه را از دست می‌دهد. ReCo با بازنگری در نحوه وزن‌دهی به پاسخ‌ها و اصلاح پارامترهای آموزشی، باعث بهبود چشمگیر عملکرد مدل‌هایی مثل Qwen2.5 و Llama-3.1 در مسائل پیچیده ریاضی شده است.

این پیشرفت گام مهمی برای رسیدن به هوش مصنوعی با توانایی حل مسئله دقیق‌تر و عمیق‌تر است! 🚀

منبع: arXiv AI