La nueva tecnología de voz de IA en el dispositivo de Apple hace que Siri suene más humano, sin enviar tu audio a la nube
Un artículo de investigación del equipo de aprendizaje automático de Apple revela el motor de audio detrás de las nuevas voces más expresivas de Siri. Todo el procesamiento ocurre en tu iPhone, utilizando un chip que ya tienes.

Puntos clave
- El modelo AFM 3 Core Advanced de Apple, la IA más capaz en el dispositivo de la empresa, ahora impulsa la función Siri Expressive Voices.
- Todo el audio se genera y procesa directamente en el dispositivo, lo que significa que no se envían datos de voz a los servidores de Apple.
- El sistema se ejecuta en el Coprocesador Apple Matrix, una unidad de procesamiento especializada integrada en los chips propios de Apple.
- Una nueva arquitectura de audio convierte tokens de audio comprimidos en voz natural y completa en tiempo real.
- Apple ML Research publicó la investigación subyacente, detallando cómo se superaron los límites de memoria ajustados en un teléfono.
Cuando Siri te habla ahora, suena notablemente más natural. Eso no es una coincidencia. Apple ha desplegado silenciosamente un sofisticado nuevo sistema de generación de audio, y un artículo publicado por Apple ML Research explica exactamente cómo funciona.
La función se llama Siri Expressive Voices. Utiliza síntesis de audio, un software que genera palabras habladas desde cero en lugar de unir clips pregrabados. Piénsalo como un motor de conversión de texto a voz muy avanzado, excepto que el resultado es rico y configurable en tiempo real.
¿Cómo funciona exactamente?
El sistema convierte texto en voz a través de dos etapas. Primero, un modelo de lenguaje grande llamado AFM 3 Core Advanced produce paquetes compactos de información de audio llamados tokens semánticos. No son sonido. Son más bien una forma abreviada comprimida de lo que el audio debería ser eventualmente.
Un segundo componente, el destokenizador, luego desempaqueta esos tokens en ondas de sonido reales. Esa segunda etapa es genuinamente la más difícil, y es donde el artículo dedica la mayor parte de sus detalles.
Los teléfonos tienen límites estrictos sobre cuánta memoria puede usar el software en cualquier momento. Para encajar la generación de audio de alta calidad dentro de esos límites, los ingenieros de Apple construyeron un diseño de tres componentes que convierte los tokens simples en un formato más rico llamado RVQ, o cuantización de vector residual. RVQ funciona como un conjunto en capas de instrucciones de audio que afinan progresivamente el sonido, similar a cómo se carga una imagen JPEG borrosa y luego se afila.
Todo esto se ejecuta en el Coprocesador Apple Matrix, o AMX, una unidad de cálculo dedicada integrada en los chips Apple Silicon. El AMX maneja el intenso cálculo numérico sin agotar el procesador principal ni la batería. Hemos seguido el desafío de encajar IA seria en el hardware de Apple desde julio: nuestro artículo del 13 de julio sobre el Siri reconstruido en la beta pública de iOS 27 mostró lo que el sistema más amplio podía hacer, y el 17 de julio informamos que Apple estaba en conversaciones con una startup que redujo un modelo de 54 gigabytes a menos de 4 gigabytes.
¿Por qué importa que todo permanezca en el dispositivo?
La privacidad es la respuesta corta. Debido a que la síntesis de audio ocurre completamente en el dispositivo, tu voz y las respuestas de Siri nunca viajan a los servidores de Apple. Nada puede ser interceptado o subpoenaado. Para los usuarios que se han preocupado por los asistentes de voz escuchando, esta arquitectura es una opción de diseño significativa, no solo un reclamo de marketing.
La velocidad es la otra ventaja. El procesamiento local significa que no hay ida y vuelta a un servidor distante, por lo que la respuesta de voz comienza casi inmediatamente.
| Componente | Función | Se ejecuta en |
|---|---|---|
| AFM 3 Core Advanced | Genera tokens de audio semánticos a partir del texto | En el dispositivo |
| Destokenizador | Convierte tokens en formas de onda de audio | Chip Apple AMX |
| Representación RVQ | Afina y añade capas de detalle de audio | En el dispositivo |
¿Qué significa esto para los usuarios comunes?
Si tu dispositivo admite la función, Siri simplemente suena mejor, sin configuración que cambiar ni opción de participación requerida. Llega a través de una actualización de software.
Lo que vale la pena observar: Apple está apostando a que poner una capacidad de IA seria en el chip, en lugar de enrutarla a través de la nube, gana tanto en privacidad como en latencia. Este motor de audio es una de las demostraciones más claras hasta ahora de cómo se ve esa apuesta en la práctica. La pregunta a seguir es si esa arquitectura en el dispositivo puede mantenerse al ritmo a medida que los modelos crecen.



