محققان در پژوهش جدید خود به سراغ یکی از چالشهای بنیادین یادگیری تقویتی (Reinforcement Learning) رفتهاند: «رفتار الگوریتمها زمانی که مدلسازی اولیه دقیق نیست».
الگوریتمهای رایجی مثل «تامپسون سمپلینگ» (Thompson Sampling) معمولاً فرض میکنند که مدل از پیش تعیینشده درست است. اما در دنیای واقعی، این مدلها اغلب نقص دارند. این مقاله با معرفی یک چارچوب «پایداری تصادفی»، رفتار این الگوریتمها را در شرایط پیچیده و غیراستاندارد دستهبندی کرده است.
این یافتهها به ما کمک میکند تا مدلهای هوش مصنوعیِ قویتر و منعطفتری برای محیطهای غیرقابل پیشبینی طراحی کنیم و از خطاهای محاسباتی در تصمیمگیریهای حساس بکاهیم.
منبع: arXiv Machine Learning
