محققان در مطالعه جدید خود به یک چالش فنی جالب در سیستمهای تبدیل متن به گفتار (TTS) پی بردهاند: ارزیابی دقت این مدلها (از طریق روش Best-of-N) به شدت تحت تأثیر این است که کدام مدل ASR (تشخیص گفتار) کار داوری را بر عهده دارد!
نتایج نشان میدهد که وابستگی بیش از حد به یک خانواده خاص از مدلهای ASR باعث خطاهای گمراهکننده در ارزیابی میشود. محققان برای حل این مشکل، راهکار جدید «Cross-family Rank Ensembles» را پیشنهاد دادهاند که با استفاده از ترکیبی از مدلهای ارزیاب، دقت خروجیها را تا حد چشمگیری بهبود میبخشد.
این تحقیق، زنگ خطری برای استانداردسازیِ روشهای گزارشدهی در مقالات هوش مصنوعی است تا ارزیابیها دقیقتر و واقعیتر انجام شوند. 💡
منبع: arXiv Machine Learning
