در دنیای «هوش مصنوعی دادهمحور» (Data-Centric AI)، کیفیت داده حرف اول را میزند. اما وقتی با میلیونها سطر داده سروکار داریم، بررسی تکتک آنها برای پیدا کردن خطاها یا دادههای پرت، عملاً غیرممکن و بسیار زمانبر است.
محققان در یک پژوهش جدید، ۹ استراتژی مختلف نمونهبرداری را برای «پروفایلینگ دادهها» در مقیاسهای میلیونی تست کردهاند. نتیجه شگفتانگیز این بود که برخلاف تصور رایج، روشهای پیچیده و هدایتشده (مانند DAG) عملکرد بسیار ضعیفتری نسبت به «نمونهبرداری تصادفی ساده» (Random Uniform) دارند!
این مطالعه نشان میدهد که برای دادههای بسیار بزرگ، سادهترین روش همچنان دقیقترین و سریعترین گزینه است و روشهای پیچیده ممکن است تا ۴۰ برابر خطای بیشتری داشته باشند. نکتهای کلیدی برای مهندسان داده که به دنبال بهینهسازی خطوط لوله (Pipelines) هوش مصنوعی خود هستند! 🚀
منبع: arXiv AI
