در دنیای یادگیری ماشین، الگوریتمهای «باندیت» (Bandit Problems) برای تصمیمگیری در شرایط عدم قطعیت بسیار کاربردی هستند. اما وقتی پاداشها در طول زمان به صورت چرخهای تغییر میکنند، الگوریتم کلاسیک Thompson Sampling دچار خطا میشود.
محققان در مقاله جدیدی روش نوآورانه «PBTS» را معرفی کردهاند. این روش با همگامسازی زمانبندیِ بهروزرسانیِ باورها و حذف دادههای قدیمی و نامعتبر در فواصل چرخهای، دقت پیشبینی را به طرز چشمگیری افزایش میدهد. این دستاورد میتواند گام بزرگی برای سیستمهای تصمیمگیر خودکار در محیطهای پویا باشد! 📈
منبع: arXiv Machine Learning
