همهی ما عادت کردهایم مدلهای زبانی (LLM) را بر اساس امتیازشان در بنچمارکهای معروفی مثل MMLU مقایسه کنیم. اما یک تحقیق جدید نشان میدهد که این رتبهبندیها ممکن است آنقدرها هم که فکر میکنیم دقیق نباشند!
محققان در این مقاله با تحلیل «عدم قطعیت در رتبهبندی»، نشان دادهاند که تنوع موضوعی در بنچمارک MMLU باعث ایجاد نوسانات آماری قابل توجهی میشود. به زبان ساده، تفاوت امتیاز دو مدل ممکن است صرفاً ناشی از ماهیت سؤالات باشد، نه لزوماً برتری واقعی یک مدل بر دیگری. این مطالعه به ما یادآوری میکند که برای شناسایی بهترین مدل، باید به «فواصل اطمینان» (Confidence Intervals) نیز توجه ویژهای داشته باشیم. 🧐
این یافته یک زنگ خطر برای همه ماست که در تحلیل نتایج مدلهای هوش مصنوعی، نگاه نقادانهتری داشته باشیم. 💡
منبع: arXiv Machine Learning
