محققان به تازگی چارچوب جدیدی به نام «ReGen» معرفی کردهاند که دنیای مدلهای انتشار (Diffusion Models) در تولید موجهای صوتی را متحول میکند.
این مدل با استفاده از معماری سلسلهمراتبی و تکنیکهای نوین، مشکل پیچیدگی دادهها را حل کرده و اجازه میدهد مدلهای تبدیل متن به گفتار (TTS) با کیفیت بسیار بالا، تنها با یک روز آموزش روی ۴ کارت گرافیک معمولی تولید شوند!
این یعنی بهرهوری بیشتر و سرعت بالاتر در پردازش صوت، آن هم با دقت و شباهت صدای فوقالعاده به صدای انسان. پروژهی «ReGenVoice» یکی از کاربردهای جذاب این فناوری است که قدرت هوش مصنوعی در درک ظرایف صوتی را به رخ میکشد.
🔗 نمونههای صوتی را میتوانید اینجا بشنوید: https://regenvoice.github.io/demo/
منبع: arXiv AI
