محققان در پژوهشی تازه، چالش دیرینه مدلهای ASR (تبدیل گفتار به متن) در تشخیص دقیق «لحن» و «زمانبندی کلمات» را هدف قرار دادهاند. در بسیاری از سیستمهای فعلی، مدلها نمیتوانند به خوبی بین گفتار محاورهای (Intended) و گفتار دقیق و کلمه به کلمه (Verbatim) تفاوت قائل شوند که باعث خطا در زمانبندی و افت کیفیت میشود.
این تحقیق با معرفی یک متد جدید و استفاده از «نشانگرهای کنترلی»، توانسته عملکرد مدلها را بهطور چشمگیری بهبود بخشد؛ بهطوری که حتی مدلهای آموزشدیده روی انگلیسی، در زبان آلمانی نیز نتایج خیرهکنندهای کسب کردهاند. همچنین ابزار جدیدی به نام «verbatimize» برای تولید دادههای متنی باکیفیت معرفی شده است که گام بزرگی برای توسعهدهندگان حوزه صدا و هوش مصنوعی محسوب میشود. 🚀
منبع: arXiv NLP
