محققان در مطالعهای تازه، اعتبارِ روشهای مرسوم تولید «دادههای مصنوعی برای اقلیتها» (Synthetic Minority Data) را به چالش کشیدهاند. سالهاست برای رفع مشکل عدم تعادل کلاسها در یادگیری ماشین، از دادههای مصنوعی استفاده میشود، اما این تحقیق نشان میدهد که روشهای ارزیابی فعلی اغلب گمراهکننده هستند.
نکات کلیدی این پژوهش:
✅ بررسی ۹۱ روش مختلف نشان میدهد که اکثر این تکنیکها عملاً سودی برای مدل ندارند.
✅ معرفی یک تست جدید (de-biased) برای سنجش واقعی اعتبار دادههای تولید شده.
✅ محققان معتقدند بهجای تکیه بر دادههای مصنوعیِ بیکیفیت، باید «اطلاعات واقعی» و «معتبر بودن» دادهها را در اولویت قرار داد.
این مقاله زنگ خطری برای محققان دادهکاوی است تا با دقت بیشتری از روشهای Over-sampling استفاده کنند.
منبع: arXiv AI
