🎧 هوش مصنوعی چندمنظوره؛ معرفی مدل قدرتمند Audex برای درک و تولید صدا

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در دستاوردی جدید، مدل زبانی «Audex-30B» را معرفی کرده‌اند که می‌تواند انقلابی در دنیای صوت و متن ایجاد کند. این مدل که بر پایه Nemotron ساخته شده، برخلاف مدل‌های قبلی، بدون کاهش قدرت در درک متن، توانایی‌های شگفت‌انگیزی در زمینه‌های زیر دارد:

توانمندی‌های کلیدی:
🔹 درک دقیق صوت و تشخیص گفتار
🔹 ترجمه هم‌زمان و تولید متن به گفتار (TTS)
🔹 تولید فایل‌های صوتی با کیفیت بالا
🔹 حفظ توانایی‌های استدلالی و دانش متنی عالی

این مدل با معماری یکپارچه خود، پلی میان متن و صداست و حالا کدهای آن برای توسعه‌دهندگان و محققان منتشر شده تا گام بزرگی در جهت هوش مصنوعی چندوجهی (Multimodal) برداشته شود. نظر شما درباره هوش مصنوعی که می‌تواند به این دقت صحبت کند و بشنود چیست؟

منبع: arXiv AI