دنیای پردازش گفتار هوش مصنوعی (Speech AI) هر روز دقیقتر میشود! محققان به تازگی روشی به نام SPAM را معرفی کردهاند که به مدلهای یادگیری خودنظارتی (S3M) کمک میکند تا آواها و بخشهای مختلف گفتار را با دقت بسیار بالا تشخیص و دستهبندی کنند.
نکته جالب اینجاست که این مدل برخلاف روشهای سنتی، نیازی به دادههای آموزشی حجیم و پیچیده ندارد و میتواند با کمتر از یک دقیقه نمونه صوتی، به درک درستی از ویژگیهای آوایی (مثل طنین و صدا) برسد. این یعنی گامی بلند به سوی دستیارهای صوتی که در آینده بسیار انسانیتر و دقیقتر با ما صحبت میکنند. 🗣✨
منبع: arXiv AI
