محققان در مقاله جدیدی از مدل هوش مصنوعی «PS4» رونمایی کردهاند که یک تحول بزرگ در استخراج دقیق صدای گوینده (Target Speaker Extraction) از میان مکالمات واقعی است. 🗣
نکته جذاب اینجاست که PS4 با استفاده از یک روش آموزشی هوشمندانه (Proxy-supervised)، یاد گرفته چطور در محیطهای شلوغ که چندین نفر همزمان صحبت میکنند، صدای هدف را با بالاترین دقت تفکیک کند. این سیستم اکنون در لیدربورد جهانی REAL-T رتبه دوم را کسب کرده و در معیارهای مهمی مثل «شباهت صدای گوینده» بهترین عملکرد را ثبت کرده است. 🚀
این فناوری میتواند کاربردهای فوقالعادهای در دستیارهای صوتی، بهبود کیفیت تماسها و ابزارهای تحلیل گفتار داشته باشد.
منبع: arXiv AI
