محققان در مقالهی جدیدی متد جذابی به نام «Warp RL» را معرفی کردهاند که یادگیری تقویتی (Reinforcement Learning) رباتها را متحول میکند.
تا پیش از این، روشهای رایج برای تطبیق سیاستهای ربات (Residual RL) تنها میتوانستند تغییرات سادهای در خروجی اعمال کنند، اما Warp RL با استفاده از «تغییر شکل توزیع کنش»، به ربات اجازه میدهد در شرایط دینامیکی جدید و پیچیده، بسیار هوشمندتر و دقیقتر عمل کند.
این روش نه تنها انعطافپذیری ربات را در تغییر محیط افزایش میدهد، بلکه در تستهای «شبیهساز به دنیای واقعی» (Sim-to-Real) نیز ۳۰ درصد سریعتر از روشهای فعلی عمل کرده است. گامی بزرگ برای رسیدن به رباتهایی که در محیطهای تغییرپذیر، با اعتمادبهنفس حرکت میکنند! 🤖✨
منبع: arXiv Machine Learning
