La nueva tecnología de voz con IA de Apple hace que Siri suene más humana, sin enviar tu audio a la nube

Un documento de investigación del equipo de aprendizaje automático de Apple revela el motor de audio detrás de las nuevas voces expresivas de Siri. Todo el procesamiento ocurre en tu iPhone, utilizando un chip que ya tienes.

AI2Day Newsdesk3 min read
A close-up of a modern smartphone lying flat on a clean white surface, its screen glowing with a soft abstract blue and white conversational interface, no reada
Share

Puntos clave

  • El modelo AFM 3 Core Advanced de Apple, la IA en el dispositivo más potente de la empresa, ahora alimenta la nueva función Voces Expresivas de Siri.
  • Todo el audio se genera y procesa directamente en el dispositivo, lo que significa que ningún dato de voz se envía a los servidores de Apple.
  • El sistema se ejecuta en el Coprocesador de Matriz de Apple, una unidad de procesamiento especializada integrada en los propios chips de Apple.
  • Una nueva arquitectura de audio convierte tokens de audio comprimido en voz natural y completa en tiempo real.
  • Apple ML Research publicó la investigación subyacente, detallando cómo se superaron los estrictos límites de memoria en un teléfono.

Cuando Siri te habla, ahora suena notablemente más natural. Eso no es una coincidencia. Apple ha implementado silenciosamente un sofisticado nuevo sistema de generación de audio, y un documento publicado por Apple ML Research explica exactamente cómo funciona.

La función se llama Voces Expresivas de Siri. Utiliza un proceso llamado síntesis de audio, que es software generando palabras habladas desde cero en lugar de unir clips pregrabados. Piénsalo como un motor de texto a voz muy avanzado, excepto que en lugar de sonar robótico, el resultado es rico y configurable en tiempo real.

¿Cómo funciona exactamente?

El sistema convierte texto en voz a través de dos etapas. Primero, un modelo de lenguaje grande llamado AFM 3 Core Advanced, un tipo de IA que entiende y genera lenguaje, produce paquetes compactos de información de audio llamados tokens semánticos. Estos aún no son sonido. Son más bien una abreviatura comprimida de lo que debería ser el audio.

Un segundo componente, llamado el destokizador, luego desempaqueta esos tokens en ondas de sonido reales que puedes escuchar. El documento describe esta segunda etapa en detalle, porque es la parte genuinamente difícil.

La dificultad es la memoria. Los teléfonos tienen límites estrictos en cuanta memoria puede usar el software en cualquier momento. Para comprimir la generación de audio de alta calidad dentro de esos límites, los ingenieros de Apple construyeron un diseño de tres partes que convierte los tokens simples en un formato de audio más rico llamado RVQ, que significa cuantificación de vector residual. Piensa en RVQ como un conjunto de instrucciones de audio en capas que progresivamente agudiza la calidad del sonido, similar a cómo carga una imagen JPEG borrosa y luego se agudiza.

Todo esto se ejecuta en el Coprocesador de Matriz de Apple, o AMX, una unidad de cálculo dedicada integrada en chips Apple Silicon como los de la serie A y M. El AMX maneja los intensos cálculos sin agotar el procesador principal ni la batería.

¿Por qué es importante que todo permanezca en el dispositivo?

La privacidad es la respuesta corta. Porque la síntesis de audio ocurre completamente en el dispositivo, tu voz y lo que Siri te dice nunca viajan a los servidores de Apple. No hay nada que interceptar, almacenar o investigar. Para los usuarios que han estado preocupados por los asistentes de voz que escuchan, esta arquitectura es una opción de diseño significativa, no solo una afirmación de marketing.

El rendimiento es el otro beneficio. El procesamiento local significa que no hay que esperar un viaje de ida y vuelta a un servidor distante. La respuesta de voz comienza casi inmediatamente.

Componente Función Se ejecuta en
AFM 3 Core Advanced Genera tokens de audio semántico a partir del texto En el dispositivo
Destokizador Convierte tokens en formas de onda de audio Chip AMX de Apple
Representación RVQ Agudiza y estratifica el detalle de audio En el dispositivo

¿Qué significa esto para los usuarios ordinarios?

Si tu dispositivo admite la función, Siri simplemente suena mejor. No necesitas cambiar ninguna configuración ni aceptar nada. La mejora llega a través de una actualización de software.

La señal más amplia es que Apple está llevando capacidad de IA seria al chip en lugar de depender de servidores en la nube. Ese enfoque prioriza la privacidad y la velocidad juntas, y este motor de audio es uno de los ejemplos más claros hasta ahora de cómo se ve eso en la práctica.

© 2026 AI2Day