محققان مدل Freya-TTS را معرفی کردهاند که یک مدل فشرده و کارآمد برای تبدیل متن به گفتار (TTS) است. نکته جذاب اینجاست که این مدل بدون نیاز به توکنایزر یا مراحل پیچیده آوایی، مستقیماً از کاراکترهای زبان ترکی استفاده میکند.
چرا Freya-TTS خاص است؟
✅ طراحی فشرده با تنها ۱۸۳ میلیون پارامتر
✅ کیفیت بسیار بالا و طبیعی در خروجی (۴۸ کیلوهرتز)
✅ عملکرد عالی حتی در متون کوتاه و حفظ ثبات صدا
✅ سرعت پردازش بالا (Real-time) و دقت بهتر نسبت به مدلهای بزرگتر مثل F5-TTS
این پیشرفت نشان میدهد که چگونه میتوان مدلهای هوش مصنوعی صوتی را برای زبانهای خاص بهینهتر و در عین حال قدرتمندتر کرد. نظر شما درباره پیشرفت مدلهای TTS برای زبانهای غیر انگلیسی چیست؟
منبع: arXiv NLP
