محققان در مطالعهای جدید، روش نوآورانهای به نام «Endpoint Replay» را برای بهبود «Experience Replay» در یادگیری تقویتی عمیق (DRL) معرفی کردهاند.
مشکل چیست؟ 🧠
بسیاری از الگوریتمهای DRL هنوز از بافرهای عظیم (معمولاً یک میلیون داده) استفاده میکنند که فضای زیادی اشغال کرده و مدیریت آن پرهزینه است.
راهکار جدید چیست؟ 💡
این متد به جای ذخیره انبوه دادهها، تنها نقاط انتهایی زنجیرههای «n-step» را ذخیره میکند. این کار نه تنها حجم حافظه مورد نیاز را به شدت کاهش میدهد (تا ۱۰ برابر)، بلکه باعث میشود مدل بدون افت دقت، کارایی بسیار بالاتری داشته باشد. آزمایشها روی بازیهای Atari نیز نشان داده که این روش عملکردی مشابه بافرهای سنتی و بزرگ دارد.
این پیشرفت میتواند راه را برای اجرای مدلهای هوش مصنوعی پیچیده روی سختافزارهای محدودتر هموارتر کند.
منبع: arXiv Machine Learning
