محققان به تازگی روش نوآورانهای را برای «استخراج صدای سخنگو» (Moving Speaker Extraction) در محیطهای پیچیده معرفی کردهاند. این مدل جدید با استفاده از «Beamforming» و دادههای Ambisonics، میتواند حتی در جلسات شلوغ یا زمانی که سخنگو در حال حرکت است، صدای او را با دقت بسیار بالا از نویز محیط جدا کند.
ویژگی کلیدی این مدل، توانایی کارکرد آن با حداقل اطلاعات اولیه (فقط جهت حدودی منبع صدا) و عملکرد عالی در سناریوهای پویا و واقعی است که آن را به گزینهای ایدهآل برای ارتقای کیفیت تماسها و کنفرانسهای ویدیویی تبدیل میکند.
منبع: arXiv Machine Learning
