🚀 تحولی در تولید صدا با هوش مصنوعی: معرفی مدل ReGen

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به تازگی چارچوب جدیدی به نام «ReGen» معرفی کرده‌اند که دنیای مدل‌های انتشار (Diffusion Models) در تولید موج‌های صوتی را متحول می‌کند.

این مدل با استفاده از معماری سلسله‌مراتبی و تکنیک‌های نوین، مشکل پیچیدگی‌ داده‌ها را حل کرده و اجازه می‌دهد مدل‌های تبدیل متن به گفتار (TTS) با کیفیت بسیار بالا، تنها با یک روز آموزش روی ۴ کارت گرافیک معمولی تولید شوند!

این یعنی بهره‌وری بیشتر و سرعت بالاتر در پردازش صوت، آن هم با دقت و شباهت صدای فوق‌العاده به صدای انسان. پروژه‌ی «ReGenVoice» یکی از کاربردهای جذاب این فناوری است که قدرت هوش مصنوعی در درک ظرایف صوتی را به رخ می‌کشد.

🔗 نمونه‌های صوتی را می‌توانید اینجا بشنوید: https://regenvoice.github.io/demo/

منبع: arXiv AI