محققان در مقالهای جدید، راهکار موثری برای بهبود «ارزیابی خارج از سیاست» (Off-Policy Evaluation) در سیستمهای رتبهبندی و توصیهگر ارائه کردهاند. تا پیش از این، SNIPS به عنوان ابزار استاندارد برای کاهش واریانس استفاده میشد، اما این پژوهش ثابت میکند که استفاده از یک «پایه افزودنی بهینه» (Optimal Additive Baseline) عملکرد بسیار بهتری نسبت به روشهای عادی دارد.
این دستاورد تئوریک، راه را برای ساخت سیستمهای هوشمند با خطای کمتر (Mean Squared Error پایینتر) هموار میکند و نشان میدهد که باید از روشهای سنتی نرمالسازی به سمت اصلاحات پایهایِ دقیقتر حرکت کرد. 🚀
گر
منبع: arXiv Machine Learning
