محققان در پژوهشی تازه، چالش قدیمی در مدلهای یادگیری ماشین را هدف قرار دادهاند: مشکل «دادههای ناقص» (Selection Bias). معمولاً مدلهای ما فرض میکنند دادهها تصادفی جمعآوری شدهاند، اما در واقعیت، فرآیند انتخاب دادهها (مثل ثبتنام برای وام یا آزمایشهای پزشکی) باعث ایجاد سوگیری میشود.
این مقاله نشان میدهد که روشهای رایج (مثل Weighting) در برابر «متغیرهای مشاهدهنشده» ناتوان هستند و برای حل آن، از تکنیک کلاسیک اقتصادسنجی یعنی «مدل دو معادلهای هکمن» استفاده کردهاند تا عدم قطعیت مدل (Epistemic Uncertainty) را به طور چشمگیری بهبود ببخشند. نتیجه کار؟ پیشبینیهای دقیقتر حتی وقتی دادههای آموزشی با واقعیتِ دنیای بیرون فاصله دارند! 🎯
منبع: arXiv Machine Learning
