محققان در یک دستاورد تازه در حوزه «یادگیری تقویتشده» (Reinforcement Learning)، روش جدیدی به نام «GEPO» (مخفف Group Entropy-Controlled Policy Optimization) را معرفی کردند.
این متد برای حل چالشهای آموزش مدلهای زبانی بزرگ (LLMs) طراحی شده است. مسئله اصلی اینجاست که وقتی مدل با ترکیبی از وظایف مختلف آموزش میبیند، میزان «آنتروپی» یا همان سطح اکتشاف مدل در هر وظیفه متفاوت است؛ GEPO با کنترل هوشمند این آنتروپی در گروههای مختلف، باعث میشود مدل ضمن جلوگیری از بیشبرازش (Over-exploitation)، در کارهای پیچیده عملکرد بسیار دقیقتری داشته باشد.
نتایج آزمایشها روی مدلهای پایه در حوزههای ریاضی، فیزیک و کدنویسی نشان میدهد که GEPO نسبت به روشهای مشابه، تعادل بهتری در یادگیری ایجاد میکند. گامی دیگر برای ساخت مدلهای استدلالگر قویتر! 📊✨
منبع: arXiv NLP
