کیفیت دادههای آموزشی، بزرگترین گلوگاه در توسعه مدلهای زبانی است! اغلب مجموعهدادههای حجیم، پر از خطاهای انسانی و تناقضهای پنهان هستند که باعث کاهش دقت و امنیت مدلها میشوند.
محققان در مقاله جدیدی، پایپلاین پیشرفتهای به نام «Beyond Shapley» را معرفی کردهاند که بدون نیاز به آموزش مجدد مدل، تأثیر واقعی هر داده بر خروجی مدل را ارزیابی میکند. این سیستم با شناسایی خودکار دادههای مخرب، توانسته است حجم بازبینیهای دستی برای مجموعهدادههای بزرگی مثل HelpSteer2 و HH-RLHF را تا ۹۹.۱ درصد کاهش دهد و خطاهای پنهان در آنها را برملا کند. یک گام بزرگ دیگر به سوی مدلهای هوش مصنوعی دقیقتر و ایمنتر! 💡🚀
منبع: arXiv Machine Learning
