مدلهای تولید متن به گفتار (TTS) گاهی با مشکلاتی مثل تکرار یا جا انداختن کلمات مواجه میشوند. حالا محققان متد جدیدی به نام «RobustSpeechFlow» معرفی کردهاند که بدون نیاز به دادههای اضافی یا مدلهای سنگین، دقت و کیفیت خروجی را به شدت افزایش میدهد.
این روش با بهبود ساختار «فلو مچینگ» (Flow Matching)، نرخ خطای کلمات (WER) را کاهش داده و باعث شده هوش مصنوعی در درک زبانهای مختلف، از جمله انگلیسی و کرهای، بسیار دقیقتر و روانتر عمل کند. گامی مهم برای دستیابی به دستیارهای صوتی که دقیقاً مثل انسان صحبت میکنند! ⚡️
🔗 برای شنیدن نمونههای صوتی به سایت پروژه سر بزنید.
منبع: arXiv Machine Learning
