🚀 معرفی “Voice Memory”: گامی نوین در تشخیص گفتار هوشمند

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی معماری جدیدی به نام «Voice Memory» را معرفی کرده‌اند که دقت تشخیص گفتار (ASR) را به طرز چشمگیری بهبود می‌بخشد. این سیستم با استفاده از یک معماری «شنونده-اندیشمند» (Listener-Thinker)، بدون تغییر در وزن‌های مدل اصلی، به صورت هوشمند تصمیم می‌گیرد که چه زمانی اصلاحات لازم است و چه زمانی باید به خروجی اولیه اعتماد کرد.

نتایج فوق‌العاده است: این تکنولوژی نه تنها نرخ خطای کلمات (WER) را در دامنه‌های مختلف کاهش داده، بلکه در شرایط نویزی و محیط‌های چالش‌برانگیز مثل کنترل‌های پرواز نیز عملکردی عالی از خود نشان داده است. نکته جذاب اینکه این حافظه هوشمند، قابل انتقال بین مدل‌های مختلف است و بدون اضافه کردن پارامترهای سنگین، دقت سیستم را بالا می‌برد.

تکنولوژی‌های این‌چنینی به ما کمک می‌کنند تا در آینده نزدیک، تعامل با دستیارهای صوتی هوشمند بسیار دقیق‌تر و قابل‌اعتمادتر شود.

منبع: arXiv AI