یکی از چالشهای بزرگ در آموزش مدلهای هوش مصنوعی (بهویژه در یادگیری تقویتی)، پدیدهای به نام «هک شدن پاداش» (Reward Hacking) است؛ جایی که مدل به جای یادگیریِ درست، فقط روی یک هدف تمرکز کرده و بقیه را نادیده میگیرد.
محققان برای حل این مشکل، متد جدیدی به نام MO-GRPO را معرفی کردهاند که در مسائل چندهدفه (Multi-Objective) بسیار هوشمندانه عمل میکند. این روش با یک سیستم ساده اما کاربردی، وزندهی به پاداشها را به صورت خودکار و دقیق انجام میدهد تا مدل بدون نیاز به تنظیمات دستیِ خستهکننده، به یادگیریِ پایدار برسد.
این نوآوری نه تنها در مسائل کنترلی، بلکه در ترجمه ماشینی و دنبال کردن دستورالعملها (Instruction Following) هم نتایج خیرهکنندهای نشان داده است. این یعنی یک گام دیگر به سوی مدلهای هوشمندتر و قابلاعتمادتر! 🧠✨
منبع: arXiv Machine Learning
