محققان در مطالعه اخیر خود روش جدیدی برای «توکنسازی هجایی» (Syllabic Tokenization) معرفی کردند که انقلابی در درک گفتار توسط هوش مصنوعی ایجاد میکند.
تا پیش از این، مدلها هنگام تحلیل گفتار، ناخودآگاه روی «هویت گوینده» تمرکز میکردند که باعث افت دقت میشد. اما با متد جدید «Speaker-Disentangled»، مدل حالا میتواند محتوای زبانی را با دقت خیرهکنندهای از صدای فرد جدا کند. این دستاورد نه تنها مرزهای تشخیص هجا را جابجا کرده، بلکه باعث بهبود ۷ درصدی در درک معنایی مدلهای زبانی گفتاری شده است.
این یعنی هوش مصنوعی در آینده میتواند بسیار دقیقتر و شبیهتر به انسان، زبانهای گفتاری را بفهمد و تحلیل کند. 🚀
منبع: arXiv AI
