📊 آیا رتبه‌بندی مدل‌های هوش مصنوعی واقعاً قابل اعتماد است؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

حتما شما هم تابه‌حال به رنکینگ‌هایی مثل Chatbot Arena برای انتخاب بهترین مدل هوش مصنوعی نگاه کرده‌اید. اما یک مطالعه جدید نشان می‌دهد که این رتبه‌بندی‌ها تا چه حد حساس و شکننده هستند! 🧐

محققان متوجه شده‌اند که حذف تنها «۰.۰۰۳ درصد» از داده‌های نظرسنجی کاربران می‌تواند جایگاه مدل‌های برتر را در Chatbot Arena تغییر دهد. این یعنی رتبه‌بندی‌های فعلی ممکن است با تغییرات بسیار جزئی در ورودی‌ها، دچار نوسان شوند.

نکته جالب اینجاست که مدل‌های ارزیابی مثل MT-bench به دلیل استفاده از داوران متخصص، مقاومت بیشتری در برابر این تغییرات نشان می‌دهند. این تحقیق زنگ خطری است برای اینکه بدانیم پشت هر عدد و رتبه‌ای، چه فرآیند حساسی نهفته است! 🤖💡

منبع: arXiv Machine Learning