محققان در یک پژوهش جدید، رویکرد نوآورانهای را برای بهبود عملکرد رباتها در حرکت (Locomotion) ارائه دادهاند. برخلاف روشهای سنتی که در آنها یادگیری ربات از صفر شروع میشود، این متد از «پیشآموزش» (Pretraining) استفاده میکند تا دانشِ تعمیمپذیر را به ربات منتقل کند.
نکته کلیدی این تحقیق، استفاده از مدلهای «دینامیک معکوس» برای گرمکردن وزنهای شبکههای Actor-Critic است. نتیجه؟ افزایش ۳۶.۲ درصدی در بهرهوری نمونهبرداری و بهبود عملکرد نهایی رباتها! این یعنی رباتها حالا سریعتر و باهوشتر از قبل یاد میگیرند که چطور در محیطهای مختلف حرکت کنند.
منبع: arXiv Machine Learning
