آیا تا به حال به این فکر کردهاید که چگونه میتوان دقیقاً همان صدای مورد نظرتان را برای سیستمهای تبدیل متن به گفتار (TTS) خلق کرد؟ محققان به تازگی چارچوب جدیدی به نام ProPS معرفی کردهاند که به شما اجازه میدهد تنها با نوشتن یک توصیف متنی (مثلاً: «مردی ۳۰ ساله با لهجه هندی»)، توزیع دقیقی از ویژگیهای صوتی مورد نظر را تولید کنید.
این مدل با استفاده از شبکههای ترکیبی، به جای مدلهای توصیفی ساده، به صورت «تولیدی» عمل میکند و میتواند ویژگیهایی مثل سن، جنسیت، لهجه و لحن بیان را به دقت کنترل کند. این دستاورد یک گام بزرگ برای ساخت سیستمهای صوتی شخصیسازیشده و بسیار طبیعی است. 🚀
منبع: arXiv AI
