مدلهای تولید متن به صوت (Text-to-Audio) اگرچه کیفیت بالایی دارند، اما گاهی در درکِ ترتیبِ زمانی صداها و جزئیات دقیق دستورات ما دچار سردرگمی میشوند. 😵💫
محققان در این پژوهش جدید، از «مدلهای زبانی بزرگِ آگاه از صدا» (ALLM) به عنوان داورهای دقیق استفاده کردهاند تا فرآیند تولید صدا را بهینهسازی کنند. این روش جدید باعث میشود هوش مصنوعی در درکِ توالی رویدادهای صوتی و پیروی از دستورات چندمرحلهای، بسیار دقیقتر عمل کند. 📈
علاوه بر این، آنها بنچمارک جدیدی به نام S3Bench معرفی کردهاند تا توانایی مدلها در روایتِ صوتیِ دقیق را بهتر بسنجند. نتیجه کار؟ صدایی باکیفیتتر و بسیار هوشمندتر که دقیقاً میداند چه چیزی را، در چه زمانی و با چه ترتیبی پخش کند! 🎼✨
منبع: arXiv Machine Learning
