محققان در دستاوردی جدید، مدل زبانی «Audex-30B» را معرفی کردهاند که میتواند انقلابی در دنیای صوت و متن ایجاد کند. این مدل که بر پایه Nemotron ساخته شده، برخلاف مدلهای قبلی، بدون کاهش قدرت در درک متن، تواناییهای شگفتانگیزی در زمینههای زیر دارد:
✨ توانمندیهای کلیدی:
🔹 درک دقیق صوت و تشخیص گفتار
🔹 ترجمه همزمان و تولید متن به گفتار (TTS)
🔹 تولید فایلهای صوتی با کیفیت بالا
🔹 حفظ تواناییهای استدلالی و دانش متنی عالی
این مدل با معماری یکپارچه خود، پلی میان متن و صداست و حالا کدهای آن برای توسعهدهندگان و محققان منتشر شده تا گام بزرگی در جهت هوش مصنوعی چندوجهی (Multimodal) برداشته شود. نظر شما درباره هوش مصنوعی که میتواند به این دقت صحبت کند و بشنود چیست؟
منبع: arXiv AI
