محققان در مقاله جدیدی، الگوریتم نوآورانه DIPOLE را معرفی کردهاند که چالشهای آموزش مدلهای دیفیوژن در حوزه یادگیری تقویتی (RL) را هدف قرار داده است.
مدلهای دیفیوژن به دلیل توانایی بالا در تولید داده، بسیار محبوب شدهاند، اما آموزش آنها با روشهای کلاسیک RL اغلب با ناپایداری یا هزینههای محاسباتی بالا همراه است. الگوریتم DIPOLE با تفکیک سیاستهای «بیشینهسازی پاداش» و «کمینهسازی پاداش» به صورت دوگانه (Dichotomous)، به محققان این امکان را میدهد که به شکلی بسیار پایدارتر و کنترلشدهتر، مدلهای خود را برای تصمیمگیری بهینه آموزش دهند. این دستاورد میتواند عملکرد سیستمهای هوش مصنوعی را در محیطهای پیچیده به طرز چشمگیری بهبود بخشد.
منبع: arXiv Machine Learning
