یکی از چالشهای اصلی در یادگیری تقویتی (Offline RL)، محدود بودن مدلها به دادههای ثابت و ناتوانی در تعمیم به سناریوهای جدید است. محققان به تازگی چارچوب جدیدی به نام RAD (مخفف Retrieval High-quAlity Demonstrations) را معرفی کردهاند که با استفاده از مکانیسم «بازیابی»، وضعیتهای با پاداش بالا را در دادههای آفلاین پیدا میکند.
این روش به ایجنت کمک میکند تا با الگوبرداری از مسیرهای موفق گذشته و استفاده از مدلهای مولد، برنامهریزی هوشمندانهتری برای رسیدن به اهداف داشته باشد. نتیجه این کار؟ عملکرد بسیار بهتر و دقیقتر ایجنتها در محیطهای پیچیده!
اطلاعات بیشتر و کدهای این پروژه در گیتهاب قابل دسترسی است.
منبع: arXiv AI
