محققان در مقاله جدید خود به سراغ اصلاح یکی از اصول پایهای در «یادگیری تقویتی» (Reinforcement Learning) رفتهاند. به جای روشهای سنتی که در آن مدلها به دنبال تخمین ارزش مطلق یک وضعیت هستند، متد جدیدی به نام «یادگیری ارزش نسبی» (Relative Value Learning) معرفی شده که تمرکز آن بر یادگیری تفاوتهای ارزشی است.
این رویکرد با معرفی یک عملگر جدید، به مدل اجازه میدهد تفاوت ارزش بین وضعیتها را مستقیماً یاد بگیرد و در نتیجه، تصمیمگیری دقیقتری در محیطهای پیچیده داشته باشد. تست این مدل روی ۴۹ بازی Atari نشان داده که این روش، جایگزینی بسیار رقابتی و کارآمد برای «منتقدان مطلق» در هوش مصنوعی است. 🎮🤖
منبع: arXiv AI
