محققان به تازگی بنچمارک جدیدی به نام MTEB-PT را معرفی کردهاند که به طور اختصاصی روی ارزیابی مدلهای تعبیه متن (Text Embedding) در زبان پرتغالی (گویش برزیلی) تمرکز دارد.
نکته جالب اینجاست که در این پژوهش، از هیچگونه ترجمه ماشینی استفاده نشده و تمام ۲۲ وظیفه تعریف شده، کاملاً بومی و اصیل هستند. نتایج این بررسی نشان میدهد که برای داشتن کیفیت عالی در زبان پرتغالی، لزوماً نیازی به APIهای تجاری گرانقیمت نیست و مدلهای متنباز (Open-weight) نیز عملکرد فوقالعادهای دارند.
این بنچمارک با ارزیابی ۹۳ مدل مختلف، گامی بزرگ برای بهبود هوش مصنوعی در زبانهایی غیر از انگلیسی برداشته است.
منبع: arXiv Machine Learning
