محققان روشی نوآورانه به نام UtterTune معرفی کردهاند که به مدلهای گفتار-به-متن (TTS) مبتنی بر مدلهای زبانی بزرگ (LLM) کمک میکند تا تلفظ دقیقتر و کنترلشدهتری در زبانهای مقصد داشته باشند.
نکته جالب اینجاست که این مدل با استفاده از تکنیک LoRA، بدون نیاز به تغییرات سنگین، اجازه میدهد جزئیات آوایی و تکیهها (Pitch Accent) در سطح فونم اصلاح شوند. این یعنی مدلهای صوتی ما میتوانند با حفظ کیفیت و شباهت به صدای اصلی، حالا با دقت بسیار بالاتری به زبانهای مختلف صحبت کنند. فعلاً این تحقیق روی زبان ژاپنی تمرکز داشته، اما پتانسیل بالایی برای سایر زبانها دارد. 🚀
منبع: arXiv NLP



