محققان در یک پژوهش جدید، راهکاری خلاقانه برای تقویت مدلهای زبانی بزرگ صوتی (Speech LLMs) ارائه دادهاند. تا پیش از این، مدلهای چندزبانه به دلیل «تداخل زبانی» در پردازشگرها، عملکرد ضعیفی داشتند.
حالا با معرفی «تقطیر آگاه از زبان» (Language-Aware Distillation)، مدلها میتوانند با استفاده از دادههای ASR (تبدیل گفتار به متن) و یک شبکه دروازهای هوشمند، دستورات صوتی را در زبانهای مختلف با دقتی خیرهکننده (تا ۱۴٪ بهبود) درک کنند. این مدل همچنین بنچمارک جدیدی به نام Audio-MLQA را برای ارزیابی بهتر کیفیت پرسش و پاسخهای صوتی معرفی کرده است. 🧠✨
گامی بزرگ برای دستیابی به دستیارهای صوتی هوشمندتر و چندزبانه!
منبع: arXiv NLP
