🔍 پاکسازی هوشمند داده‌ها برای مدل‌های زبانی: معرفی سیستم جدید Beyond Shapley

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

کیفیت داده‌های آموزشی، بزرگ‌ترین گلوگاه در توسعه مدل‌های زبانی است! اغلب مجموعه‌داده‌های حجیم، پر از خطاهای انسانی و تناقض‌های پنهان هستند که باعث کاهش دقت و امنیت مدل‌ها می‌شوند.

محققان در مقاله جدیدی، پایپ‌لاین پیشرفته‌ای به نام «Beyond Shapley» را معرفی کرده‌اند که بدون نیاز به آموزش مجدد مدل، تأثیر واقعی هر داده بر خروجی مدل را ارزیابی می‌کند. این سیستم با شناسایی خودکار داده‌های مخرب، توانسته است حجم بازبینی‌های دستی برای مجموعه‌داده‌های بزرگی مثل HelpSteer2 و HH-RLHF را تا ۹۹.۱ درصد کاهش دهد و خطاهای پنهان در آن‌ها را برملا کند. یک گام بزرگ دیگر به سوی مدل‌های هوش مصنوعی دقیق‌تر و ایمن‌تر! 💡🚀

منبع: arXiv Machine Learning