با پیشرفت مدلهای تولید صوت (Generative AI)، تشخیص اینکه آیا صدایی که میشنویم واقعی است یا توسط هوش مصنوعی ساخته شده، به چالشی بزرگ تبدیل شده است. محققان در پژوهش جدیدی به سراغ تحلیل «طیف فرکانسی آواها» رفتهاند.
این روش که با مطالعه روی زبان ژاپنی انجام شده، تفاوتهای ظریفی را کشف کرده است: در حالی که اندامهای گفتاری انسان طیف متنوع و منعطفی از آواها را تولید میکنند، صدای هوش مصنوعی به دلیل محدودیت در دادههای آموزشی، الگوهای تکراریتری دارد. با استفاده از «متریک واشتاین» و نقشهبرداری توپولوژیک، حالا میتوان صدای واقعی و مصنوعی را با دقت بالاتری از هم تفکیک کرد. قدمی مهم برای مقابله با دیپفیکهای صوتی! 🛡️
منبع: arXiv AI
