محققان به تازگی گام مهمی در بهبود بهرهوریِ مدلهای یادگیری تقویتی (RL) برداشتهاند. مشکل اصلی در روشهای سنتی این بود که مدلها برای یادگیری به دادههای آفلاین و ثابت وابستگی داشتند که کیفیت آنها همیشه ایدهآل نبود.
الگوریتم جدید EBP با استفاده از یک ساختار هوشمند (Q-CVAE)، یاد گرفته است که به جای اتکا به دادههای پیشفرض، تجربیات برتر را مستقیماً از حافظه اجرایی (Replay Buffer) تولید کند. این یعنی ایجنتها حالا میتوانند بدون نیاز به دادههای آماده، رفتارهای بهینه را خودشان کشف کنند و در محیطهای پیچیدهای مثل رباتیک و کنترل صنعتی، پایدارتر و هوشمندتر عمل کنند.
این پیشرفت میتواند سرعت یادگیری مدلهای RL را در پروژههای عملیاتی به شدت افزایش دهد. نظر شما چیست؟ آیا این مسیر میتواند هوش مصنوعی را در یادگیری مهارتهای فیزیکی به انسان نزدیکتر کند؟
منبع: arXiv AI
