شاید فکر کنید هرچه کیفیت فایل صوتی بالاتر و نویز آن کمتر باشد، مدلهای تبدیل گفتار به متن (ASR) مثل Whisper عملکرد دقیقتری دارند؛ اما نتایج یک پژوهش تازه نشان میدهد که همیشه اینطور نیست!
محققان در این مطالعه بررسی کردند که چگونه ابزارهای پیشپردازش صوتی مثل SAM-Audio بر عملکرد مدلهای «Zero-shot» تاثیر میگذارند. نتیجه شگفتآور بود: با وجود اینکه کیفیت سیگنال صدا افزایش مییابد، دقت مدلهای Whisper در ترجمه (WER/CER) بهویژه در زبانهایی مانند بنگالی و حتی انگلیسی کاهش پیدا میکند.
این یافته یادآوری میکند که دنیای هوش مصنوعی پر از تضادهای جالب است و گاهی تلاش برای «بهتر کردن» دادهها، میتواند سیستم را سردرگم کند! نظر شما چیست؟ آیا هوش مصنوعی در محیطهای نویزی از پسِ درک واقعیت برمیآید؟
منبع: arXiv AI
