محققان در مطالعه جدید خود به سراغ چالشهای «بهینهسازی سیاست گروهی» یا همان GRPO برای آموزش مدلهای کوچک زبانی (مانند Qwen-0.5B) در کنترل رباتهای چهارپایه رفتهاند.
نکته جالب اینجاست که در محیطهای کنترل پیوسته، مدلها دچار مشکل میشوند، اما با تغییر فضای اقدام (Action Space) به انتخابهای گسسته، آموزش به پایداری میرسد و نتایج درخشانی در عملکرد حاصل میشود. این یافته، بینش مهمی برای توسعهدهندگان ایجنتهایی است که با محیطهای فیزیکی در تعامل هستند.
های_زبانی
منبع: arXiv AI
