تحول بزرگی در دنیای تبدیل متن به گفتار (TTS) در راه است. مدلهای فعلی بر پایه مدلهای زبانی بزرگ (LLM) شاید طبیعی صحبت کنند، اما کنترل دقیقی روی جزئیات لحن و زیروبمی کلمات ندارند.
محققان در مقاله جدیدی، فریمورک «WordVoice» را معرفی کردهاند که به هوش مصنوعی اجازه میدهد روی تکتک کلمات و ویژگیهایی مثل انرژی، لحن و زمانبندی کنترل دقیق داشته باشد. این یعنی خداحافظی با لحنهای یکنواخت و سلام به صداپیشگی حرفهای برای کتابهای صوتی و دوبله ویدیوها با دقت بالا! 🚀
این پیشرفت با استفاده از یک دیتاسِت عظیم و معماری جدید برای «برنامهریزی صوتی» محقق شده است. قدم بزرگی برای طبیعیتر شدن هرچه بیشتر صدای رباتها!
منبع: arXiv NLP
