🎙 پیشرفت خیره‌کننده در تشخیص صدای گوینده با مدل PS4

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی از مدل هوش مصنوعی «PS4» رونمایی کرده‌اند که یک تحول بزرگ در استخراج دقیق صدای گوینده (Target Speaker Extraction) از میان مکالمات واقعی است. 🗣

نکته جذاب اینجاست که PS4 با استفاده از یک روش آموزشی هوشمندانه (Proxy-supervised)، یاد گرفته چطور در محیط‌های شلوغ که چندین نفر همزمان صحبت می‌کنند، صدای هدف را با بالاترین دقت تفکیک کند. این سیستم اکنون در لیدربورد جهانی REAL-T رتبه دوم را کسب کرده و در معیارهای مهمی مثل «شباهت صدای گوینده» بهترین عملکرد را ثبت کرده است. 🚀

این فناوری می‌تواند کاربردهای فوق‌العاده‌ای در دستیارهای صوتی، بهبود کیفیت تماس‌ها و ابزارهای تحلیل گفتار داشته باشد.

منبع: arXiv AI