محققان با معرفی «Faster IndexTTS-2»، یکی از بزرگترین موانع مدلهای تبدیل متن به گفتار (TTS) یعنی «کند بودن در زمان اجرا» را هدف قرار دادهاند.
این مدل جدید که با استفاده از تکنولوژیهای NVIDIA TensorRT بهینهسازی شده، موفق شده تا سرعت تولید صدا را تا ۳.۶ برابر افزایش دهد، آن هم بدون اینکه افت محسوسی در کیفیت یا شباهت به صدای واقعی ایجاد شود. این یعنی ما به دنیای اپلیکیشنهای تعاملی با تأخیر (Latency) بسیار پایین و پردازش بلادرنگ نزدیکتر شدیم. ⚡️
اگر در حوزه تولید محتوای صوتی یا مدلهای زبانی فعالیت میکنید، این دستاورد یک قدم بزرگ برای استفادههای عملیاتی و صنعتی از مدلهای تولید صداست.
منبع: arXiv AI
