🚀 چالش جدید در آموزش مدل‌های کوچک: کنترل پیوسته یا گسسته؟ 🤖

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مطالعه جدید خود به سراغ چالش‌های «بهینه‌سازی سیاست گروهی» یا همان GRPO برای آموزش مدل‌های کوچک زبانی (مانند Qwen-0.5B) در کنترل ربات‌های چهارپایه رفته‌اند.

نکته جالب اینجاست که در محیط‌های کنترل پیوسته، مدل‌ها دچار مشکل می‌شوند، اما با تغییر فضای اقدام (Action Space) به انتخاب‌های گسسته، آموزش به پایداری می‌رسد و نتایج درخشانی در عملکرد حاصل می‌شود. این یافته، بینش مهمی برای توسعه‌دهندگان ایجنت‌هایی است که با محیط‌های فیزیکی در تعامل هستند.

‌های_زبانی

منبع: arXiv AI