محققان در پژوهشی جدید، راهکار هوشمندانهای برای بهبود «یادگیری و ارزیابی سیاستها» (OPE/L) در سیستمهای تصمیمگیر (Contextual Bandits) ارائه دادهاند.
مشکل اصلی این است که در حوزههای حساسی مثل پزشکی شخصیسازی شده یا سیستمهای توصیهگر، دادههای کافی یا باکیفیت برای آموزش مدل وجود ندارد. این روش جدید با استفاده از دادههای «دامنههای دیگر» (Cross-Domain) و ترکیب آنها با دادههای موجود، به مدل کمک میکند تا حتی در شرایطی که دادههای کمی در اختیار داریم، عملکردی دقیق و قابلاعتماد داشته باشد. 🤖💡
این نوآوری میتواند دریچه جدیدی برای مدلهای هوش مصنوعی باز کند تا در شرایط دنیای واقعی که با کمبود دادههای برچسبخورده مواجه هستیم، بهتر عمل کنند.
منبع: arXiv Machine Learning
