محققان در مطالعه جدید خود متوجه شدند که بنچمارکهای فعلی برای زبانهایی مثل پرتغالی کافی نیستند و مدلهای هوش مصنوعی اغلب بر اساس استانداردهای انگلیسی قضاوت میشوند.
این مقاله با معرفی MTEB-PT، مجموعهای از ۱۴ دیتاست مختلف را برای ارزیابی دقیق مدلهای Embedding در وظایفی مثل بازیابی اطلاعات و طبقهبندی متون پرتغالی ارائه کرده است. نتایج نشان میدهد که مدلهای چندزبانه همیشه عملکرد یکسانی ندارند و برای بهبود دقت، همچنان به Fine-tuning تخصصی زبان نیاز است. این کار گامی مهم برای عادلانه کردن ارزیابی مدلهای هوش مصنوعی در سطح جهانی است. 🌍✨
منبع: arXiv AI
