یکی از بزرگترین چالشهای مدلهای هوش مصنوعی در محیطهای واقعی، پردازش زنده (Streaming) صداست. مدلهای قبلی معمولاً برای کارایی بالا به کل محتوای صوتی نیاز داشتند که باعث ایجاد تاخیر میشد.
محققان با معرفی معماری جدید StarTSE، راهکاری مبتنی بر مدلهای زبانی ارائه کردهاند که با استفاده از تکنیک «تقطیع و چیدمان هوشمند»، میتواند صدای گوینده هدف را با کیفیت بسیار بالا و بدون تاخیرهای آزاردهنده جدا کند. این مدل نه تنها روی کارت گرافیکهای معمولی بسیار سریع عمل میکند، بلکه در تستهای کیفیت صدا نیز عملکردی خیرهکننده و همتراز با سیستمهای آفلاین داشته است.
این پیشرفت یعنی در آینده نزدیک، دستیارهای صوتی و ابزارهای ارتباطی میتوانند بسیار دقیقتر و سریعتر نویزهای محیطی را حذف و صدای اصلی را ایزوله کنند. 🎧🚀
منبع: arXiv AI
