📊 ارزیابی دقیق‌تر مدل‌های زبانی؛ معرفی بنچمارک MTEB-PT برای زبان پرتغالی

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه جدید خود متوجه شدند که بنچمارک‌های فعلی برای زبان‌هایی مثل پرتغالی کافی نیستند و مدل‌های هوش مصنوعی اغلب بر اساس استانداردهای انگلیسی قضاوت می‌شوند.

این مقاله با معرفی MTEB-PT، مجموعه‌ای از ۱۴ دیتاست مختلف را برای ارزیابی دقیق مدل‌های Embedding در وظایفی مثل بازیابی اطلاعات و طبقه‌بندی متون پرتغالی ارائه کرده است. نتایج نشان می‌دهد که مدل‌های چندزبانه همیشه عملکرد یکسانی ندارند و برای بهبود دقت، همچنان به Fine-tuning تخصصی زبان نیاز است. این کار گامی مهم برای عادلانه کردن ارزیابی مدل‌های هوش مصنوعی در سطح جهانی است. 🌍✨

منبع: arXiv AI