محققان به تازگی معماری جدیدی به نام «Voice Memory» را معرفی کردهاند که دقت تشخیص گفتار (ASR) را به طرز چشمگیری بهبود میبخشد. این سیستم با استفاده از یک معماری «شنونده-اندیشمند» (Listener-Thinker)، بدون تغییر در وزنهای مدل اصلی، به صورت هوشمند تصمیم میگیرد که چه زمانی اصلاحات لازم است و چه زمانی باید به خروجی اولیه اعتماد کرد.
نتایج فوقالعاده است: این تکنولوژی نه تنها نرخ خطای کلمات (WER) را در دامنههای مختلف کاهش داده، بلکه در شرایط نویزی و محیطهای چالشبرانگیز مثل کنترلهای پرواز نیز عملکردی عالی از خود نشان داده است. نکته جذاب اینکه این حافظه هوشمند، قابل انتقال بین مدلهای مختلف است و بدون اضافه کردن پارامترهای سنگین، دقت سیستم را بالا میبرد.
تکنولوژیهای اینچنینی به ما کمک میکنند تا در آینده نزدیک، تعامل با دستیارهای صوتی هوشمند بسیار دقیقتر و قابلاعتمادتر شود.
منبع: arXiv AI
