محققان اپل در مقالهای جدید، راهکار بسیار هوشمندانهای برای تولید صدای باکیفیت روی دستگاه (On-device) معرفی کردهاند. این تکنولوژی که در مدلهای جدید «Siri Expressive Voices» به کار رفته، به مدل اجازه میدهد با مصرف بسیار ناچیز حافظه (تنها ۲۱ مگابایت رم!) و سرعتی ۱۶ برابر سریعتر از حالت عادی، صداهای طبیعی تولید کند.
این معماری با تفکیک هوشمندانه پردازشهای زمانی و عمقی، مشکل مقیاسپذیری ترنسفورمرهای سنتی را حل کرده و راه را برای استفاده از هوش مصنوعی قدرتمند صوتی در گوشیهای موبایل بدون نیاز به سرور ابری هموارتر کرده است. 📱✨
منبع: arXiv NLP
