La IA de voz abierta y gratuita de NVIDIA ahora habla 12 idiomas y responde en menos de una décima de segundo

Una nueva versión del modelo de síntesis de voz Magpie de NVIDIA añade árabe, coreano y portugués, y se ejecuta lo suficientemente rápido en tu propio hardware para que los asistentes de voz se sientan naturales.

AI2Day NewsdeskUpdated Editor: Lee Brown4 min read
A vast server room filled with rows of illuminated blue and white rack-mounted computers stretching into the distance, cool dramatic lighting reflecting off pol
Share

Puntos clave

  • NVIDIA Magpie Multilingual TTS, un modelo de síntesis de voz de pesos abiertos gratuito, ahora soporta 12 idiomas después de añadir árabe, coreano y portugués brasileño en su última versión.
  • En el chip B200 de NVIDIA, el modelo produce sus primeros audios en apenas 32 milisegundos, muy por debajo del umbral donde los humanos notan una pausa.
  • Los desarrolladores pueden descargar y ejecutar el modelo completamente en sus propias computadoras o servidores, sin que se envíe dato alguno a la nube de NVIDIA.
  • La tasa de error de caracteres en francés, una medida de la precisión con que el modelo pronuncia las palabras, bajó de 2,70% a 1,54% en comparación con la versión anterior.
  • La arquitectura del modelo y sus puntos de referencia están documentados en un artículo aceptado en ICASSP 2026, una conferencia de investigación de audio líder.

Cuando le haces una pregunta a un asistente de voz, un reloj invisible comienza a contar en el momento en que dejas de hablar. Tus palabras se transcriben, una IA elabora una respuesta y luego un motor de síntesis de voz convierte esa respuesta en sonido. Este último paso es el que tus oídos juzgan con más severidad. Si la voz tarda demasiado en empezar a hablar, todo el intercambio se siente roto.

NVIDIA quiere solucionar esto con Magpie Multilingual TTS, un modelo de síntesis de voz lanzado como pesos abiertos, lo que significa que los archivos completos del modelo entrenado son gratuitos para descargar y ejecutar en cualquier lugar. La última actualización, detallada por primera vez en Hugging Face, expande el modelo a 12 idiomas y mejora la naturalidad en varios de los existentes. Cubrimos el lanzamiento original de Magpie en 10 de agosto de 2026, cuando la IA de voz en dispositivo también avanzaba en Apple.

¿Qué cambió exactamente NVIDIA?

Tres idiomas se unen al repertorio: árabe moderno estándar, coreano y portugués brasileño. Esto eleva el total a 12, todos manejados por una única descarga de 364 millones de parámetros en lugar de modelos regionales separados.

La calidad también mejoró para los idiomas existentes. La pronunciación en francés se ajustó significativamente; el español le siguió de cerca.

Idioma Tasa de error antes Tasa de error ahora Coincidencia de voz antes Coincidencia de voz ahora
Francés 2,70% 1,54% 0,703 0,747
Español 1,14% 0,60% 0,715 0,793
Alemán 0,66% 0,80% 0,626 0,742

Fuente: tarjeta del modelo Magpie TTS Multilingual. Una tasa de error más baja es mejor; una puntuación de coincidencia de voz más alta es mejor.

¿Qué tan rápido habla realmente?

Lo suficientemente rápido para que la mayoría de las personas no noten una pausa. En un B200 de NVIDIA, el tipo de chip que se encuentra en centros de datos de alta gama, el modelo comienza a producir audio 32 milisegundos después de recibir el texto. Eso es aproximadamente una treceava parte de un segundo. En un A100, un chip más antiguo ampliamente implementado, esa pausa es de 79 milisegundos.

Los humanos comienzan a percibir una conversación como incómoda cuando las respuestas superan aproximadamente 200 milisegundos. El paso de síntesis de voz de Magpie deja la mayor parte de ese presupuesto libre para la transcripción e inferencia.

Dos opciones de ingeniería impulsan la velocidad. El modelo predice dos fragmentos de audio a la vez en lugar de uno durante cada paso de procesamiento, reduciendo a la mitad las iteraciones necesarias. Una pequeña red adicional llamada transformador local limpia cualquier pérdida de calidad resultante de hacer esto, manteniendo la voz sonando natural.

¿Por qué importa ejecutarlo tú mismo?

La mayoría de los servicios comerciales de síntesis de voz están basados en la nube: tu texto viaja a un servidor remoto, se convierte en audio y viaja de vuelta. Cada viaje cuesta tiempo y pone a un tercero en contacto con tus datos.

Como los pesos de Magpie son abiertos, un proveedor de atención médica o una institución financiera con reglas estrictas de residencia de datos puede ejecutarlo en sus propios servidores. El audio nunca sale del edificio. Los desarrolladores también pueden ajustar finamente el modelo con sus propias muestras de voz o vocabulario especializado, algo que una API comercial cerrada no permite. Esa es la brecha práctica entre esto y algo como el servicio en la nube de Fish Audio, donde entregas tus datos a la infraestructura de otra persona.

Los números que más importan aquí no son las cifras de latencia, impresionantes como lo es 32 ms. Son las puntuaciones de calidad: la tasa de error del alemán en realidad subió ligeramente en esta versión, de 0,66% a 0,80%, incluso cuando el francés y el español mejoraron significativamente. Ese es el que hay que vigilar mientras NVIDIA avanza hacia un modelo multilingüe genuinamente equilibrado.

© 2026 AI2Day