🎙️ تحول در دقت تشخیص گفتار: پایان ابهام در رونوشت‌های هوش مصنوعی! 🤖

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی تازه، چالش دیرینه مدل‌های ASR (تبدیل گفتار به متن) در تشخیص دقیق «لحن» و «زمان‌بندی کلمات» را هدف قرار داده‌اند. در بسیاری از سیستم‌های فعلی، مدل‌ها نمی‌توانند به خوبی بین گفتار محاوره‌ای (Intended) و گفتار دقیق و کلمه به کلمه (Verbatim) تفاوت قائل شوند که باعث خطا در زمان‌بندی و افت کیفیت می‌شود.

این تحقیق با معرفی یک متد جدید و استفاده از «نشانگرهای کنترلی»، توانسته عملکرد مدل‌ها را به‌طور چشمگیری بهبود بخشد؛ به‌طوری که حتی مدل‌های آموزش‌دیده روی انگلیسی، در زبان آلمانی نیز نتایج خیره‌کننده‌ای کسب کرده‌اند. همچنین ابزار جدیدی به نام «verbatimize» برای تولید داده‌های متنی باکیفیت معرفی شده است که گام بزرگی برای توسعه‌دهندگان حوزه صدا و هوش مصنوعی محسوب می‌شود. 🚀

منبع: arXiv NLP