محققان در مقاله جدیدی، الگوریتم نوآورانهای به نام «Kernel-WIS» را معرفی کردهاند که به طور خاص برای ارزیابی «سیاستهای آفلاین» (Off-policy evaluation) در مسائل contextual bandits طراحی شده است.
این روش که بر پایه تکنیکهای وزندهی اهمیت (Importance Sampling) بنا شده، مشکلاتی مثل عدم دقت مدلهای رفتاری را با ترکیب ویژگیهای مثبت روشهای موجود حل میکند. این یعنی در سناریوهایی که دادههای آموزشی محدود یا ناقص هستند، میتوانیم با اطمینان بیشتری عملکرد سیستمهای تصمیمگیر هوش مصنوعی را بسنجیم. این دستاورد میتواند گام مهمی در بهبود سیستمهای پیشنهادی (Recommendation Systems) و اتوماسیون تصمیمگیری باشد. 🚀
منبع: arXiv Machine Learning
