حتما شما هم تابهحال به رنکینگهایی مثل Chatbot Arena برای انتخاب بهترین مدل هوش مصنوعی نگاه کردهاید. اما یک مطالعه جدید نشان میدهد که این رتبهبندیها تا چه حد حساس و شکننده هستند! 🧐
محققان متوجه شدهاند که حذف تنها «۰.۰۰۳ درصد» از دادههای نظرسنجی کاربران میتواند جایگاه مدلهای برتر را در Chatbot Arena تغییر دهد. این یعنی رتبهبندیهای فعلی ممکن است با تغییرات بسیار جزئی در ورودیها، دچار نوسان شوند.
نکته جالب اینجاست که مدلهای ارزیابی مثل MT-bench به دلیل استفاده از داوران متخصص، مقاومت بیشتری در برابر این تغییرات نشان میدهند. این تحقیق زنگ خطری است برای اینکه بدانیم پشت هر عدد و رتبهای، چه فرآیند حساسی نهفته است! 🤖💡
منبع: arXiv Machine Learning
