🎙 تولید صدا فقط با یک عکس؛ نوآوری جدید در دنیای هوش مصنوعی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی مدل جدیدی به نام «Face-to-Speech» معرفی کردند که می‌تواند تنها با استفاده از یک تصویر ثابت از صورت یک فرد، صدای احتمالی او را با دقت بسیار بالایی بازسازی کند! 🤯

این فناوری که در واقع یک «Face Adapter» برای مدل StyleTTS 2 است، نیاز به فایل صوتی مرجع را از بین می‌برد و برای بازسازی صدای شخصیت‌های تاریخی یا حتی کاراکترهای بازی‌های ویدئویی بسیار کاربردی است. نکته جالب توجه اینجاست که این مدل حتی می‌تواند به زبان‌های دیگر هم صحبت کند، بدون اینکه نیاز به آموزش مجدد داشته باشد! 🗣✨

تکنولوژی به سمتی می‌رود که دیگر مرز بین واقعیت و شبیه‌سازی‌های دیجیتال هر روز کمرنگ‌تر می‌شود.

منبع: arXiv AI