محققان در پژوهشی جدید، چارچوب نوآورانهای را برای «یادگیری تقویتی تفاوت زمانی» (TD) معرفی کردهاند. برخلاف روشهای کلاسیک که به فرضیات خطی-گوسی محدود بودند، این روش جدید بر پایه نظریه انتظارات شرطی بنا شده و به مدلها اجازه میدهد در سیستمهای غیرخطی و توزیعهای غیرگوسی، علاوه بر تخمین مقدار (Value)، «میزان عدم قطعیت» خود را نیز محاسبه کنند.
این دستاورد میتواند گام بزرگی برای افزایش پایداری و دقت مدلهای هوش مصنوعی در محیطهای پیچیده و سیستمهای کنترلی باشد.
منبع: arXiv Machine Learning
