محققان در یک مطالعه جدید، عملکرد مدل Gemma-3 را در تصحیح خودکار مقالات آزمون تافل بررسی کردهاند. نتایج بسیار قابلتأمل است!
با اینکه این مدل در دقت نمرهدهی بسیار موفق عمل کرده، اما یک «سوگیری سیستمی» در آن دیده شده است؛ به طوری که مقالات داوطلبان با زبان مادری اروپایی، بهطور میانگین نمرات بالاتری نسبت به داوطلبان آسیای شرقی دریافت کردهاند. این پژوهش زنگ خطری جدی برای توسعهدهندگان است تا در آموزش مدلهای هوش مصنوعی، به عدالت زبانی و نژادی توجه بیشتری کنند. 🤖⚖️
منبع: arXiv NLP
