🔍 آیا نویزگیری صدا همیشه به نفع هوش مصنوعی است؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

شاید فکر کنید هرچه کیفیت فایل صوتی بالاتر و نویز آن کمتر باشد، مدل‌های تبدیل گفتار به متن (ASR) مثل Whisper عملکرد دقیق‌تری دارند؛ اما نتایج یک پژوهش تازه نشان می‌دهد که همیشه این‌طور نیست!

محققان در این مطالعه بررسی کردند که چگونه ابزارهای پیش‌پردازش صوتی مثل SAM-Audio بر عملکرد مدل‌های «Zero-shot» تاثیر می‌گذارند. نتیجه شگفت‌آور بود: با وجود اینکه کیفیت سیگنال صدا افزایش می‌یابد، دقت مدل‌های Whisper در ترجمه (WER/CER) به‌ویژه در زبان‌هایی مانند بنگالی و حتی انگلیسی کاهش پیدا می‌کند.

این یافته یادآوری می‌کند که دنیای هوش مصنوعی پر از تضادهای جالب است و گاهی تلاش برای «بهتر کردن» داده‌ها، می‌تواند سیستم را سردرگم کند! نظر شما چیست؟ آیا هوش مصنوعی در محیط‌های نویزی از پسِ درک واقعیت برمی‌آید؟

منبع: arXiv AI