محققان در مطالعه جدیدی به چالشهای پیچیده «ترازسازی گفتار» (Forced Alignment) در زبانهای ترکیبی (Code-mixed) پرداختهاند. ترازسازی گفتار یکی از مراحل کلیدی در پردازش صوت و هوش مصنوعی است که دقت آن برای تبدیل دقیق گفتار به متن بسیار حیاتی است.
نتایج این تحقیق نشان میدهد که با استفاده از مدلهای صوتی آموزشدیده روی دادههای ترکیبی و طراحی دقیق لغتنامهها، خطای مدل تا ۱۰ برابر نسبت به مدلهای تکزبانه کاهش یافته و به دقت خیرهکننده ۴.۱۵ میلیثانیه رسیده است.
این دستاورد گام مهمی برای بهبود دستیارهای صوتی هوشمند در محیطهای چندزبانه و جوامعی است که بهطور روزمره از ترکیب دو زبان در مکالمات خود استفاده میکنند. 🚀
منبع: arXiv NLP
