🎙 کنترل کامل بر ویژگی‌های صدا با هوش مصنوعی؛ معرفی ProPS

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا تا به حال به این فکر کرده‌اید که چگونه می‌توان دقیقاً همان صدای مورد نظرتان را برای سیستم‌های تبدیل متن به گفتار (TTS) خلق کرد؟ محققان به تازگی چارچوب جدیدی به نام ProPS معرفی کرده‌اند که به شما اجازه می‌دهد تنها با نوشتن یک توصیف متنی (مثلاً: «مردی ۳۰ ساله با لهجه هندی»)، توزیع دقیقی از ویژگی‌های صوتی مورد نظر را تولید کنید.

این مدل با استفاده از شبکه‌های ترکیبی، به جای مدل‌های توصیفی ساده، به صورت «تولیدی» عمل می‌کند و می‌تواند ویژگی‌هایی مثل سن، جنسیت، لهجه و لحن بیان را به دقت کنترل کند. این دستاورد یک گام بزرگ برای ساخت سیستم‌های صوتی شخصی‌سازی‌شده و بسیار طبیعی است. 🚀

منبع: arXiv AI