محققان در تازهترین دستاورد خود، مدل جدیدی به نام TokAN را معرفی کردهاند که میتواند لهجههای مختلف انگلیسی را به گفتاری استاندارد (L1) تبدیل کند، بدون اینکه هویت و ویژگیهای صدای گوینده از بین برود!
نکته جذاب این مدل این است که برای آموزش به دیتای صوتی جفتشده (L1-L2) نیازی ندارد و از توکنهای گسسته گفتاری استفاده میکند. همچنین با بهرهگیری از یادگیری تقویتی (RL)، کیفیت خروجی را به شکل قابل توجهی بهبود داده و نرخ خطای کلمات (WER) را کاهش داده است.
این فناوری میتواند کاربردهای فوقالعادهای در صنعت دوبله، تولید محتوای زنده و سیستمهای ترجمه همزمان داشته باشد تا موانع زبانی به حداقل برسند. 🚀
منبع: arXiv AI
