محققان در مقالهای جدید از روش نوآورانه «Latent Policy Steering» (به اختصار LPS) رونمایی کردهاند که تحولی در یادگیری تقویتی آفلاین برای رباتها ایجاد میکند.
مشکل اصلی در این حوزه، ناتوانی مدلها در حفظ تعادل بین «به حداکثر رساندن بازده» و «رعایت محدودیتهای رفتاری» بود که معمولاً منجر به تنظیمات پیچیده و ناکارآمد میشد. اما متد LPS با حذف منتقدهای واسطه و استفاده از سیاستهای یکمرحلهای (MeanFlow) بهعنوان یک پیشزمینه مولد، اجازه میدهد که رباتها بدون نیاز به تنظیمات دشوار، تصمیمات بسیار بهینهتر و دقیقتری بگیرند.
این متد نهتنها در شبیهسازها، بلکه در تستهای دنیای واقعی نیز عملکردی خیرهکننده داشته و توانسته است استانداردهای جدیدی را برای هدایت سیاستهای رباتیک تعریف کند. 🤖⚙️
منبع: arXiv Machine Learning
