A Nova Tecnologia de Voz IA da Apple Torna a Siri Mais Humana, Sem Enviar o Seu Áudio para a Nuvem
Um artigo de investigação da equipa de aprendizagem automática da Apple revela o motor de áudio por trás das novas vozes expressivas da Siri. Todo o processamento acontece no seu iPhone, utilizando um chip que já possui.

Pontos-chave
- O modelo AFM 3 Core Advanced da Apple, o seu IA mais capaz no dispositivo, potencia agora a nova funcionalidade Vozes Expressivas da Siri.
- Todo o áudio é gerado e processado diretamente no dispositivo, o que significa que nenhum dado de voz é enviado para os servidores da Apple.
- O sistema funciona no Coprocessador Apple Matrix, uma unidade de processamento especializada incorporada nos chips próprios da Apple.
- Uma nova arquitetura de áudio converte tokens de áudio comprimidos em fala completa e natural em tempo real.
- A Apple ML Research publicou a investigação subjacente, detalhando como foram ultrapassados os limites rigorosos de memória de um telefone.
Quando a Siri lhe fala, agora soa notavelmente mais natural. Isto não é uma coincidência. A Apple enviou silenciosamente um sofisticado novo sistema de geração de áudio, e um artigo publicado pela Apple ML Research explica exatamente como funciona.
A funcionalidade chama-se Vozes Expressivas da Siri. Utiliza um processo chamado síntese de áudio, que é software gerando palavras faladas do zero em vez de juntar clips pré-gravados. Pense nisto como um motor de conversão de texto em fala muito avançado, exceto que, em vez de soar robótico, o resultado é rico e configurável em tempo real.
Como funciona realmente?
O sistema converte texto em fala através de dois estágios. Primeiro, um grande modelo de linguagem chamado AFM 3 Core Advanced, um tipo de IA que compreende e gera linguagem, produz pacotes compactos de informação de áudio chamados tokens semânticos. Ainda não são som. São mais como uma abreviatura comprimida do que o áudio deveria ser.
Um segundo componente, chamado detokenizador, depois descompacta esses tokens em ondas sonoras reais que pode ouvir. O artigo descreve este segundo estágio em detalhe, porque é a parte genuinamente difícil.
A dificuldade é a memória. Os telefones têm limites rigorosos de quanto a memória o software pode utilizar em qualquer momento. Para encaixar a geração de áudio de alta qualidade nesses limites, os engenheiros da Apple construíram um design de três partes que converte os tokens simples num formato de áudio mais rico chamado RVQ, que significa quantização de vetores residuais. Pense em RVQ como um conjunto em camadas de instruções de áudio que progressivamente aguçam a qualidade do som, semelhante à forma como uma imagem JPEG carrega desfocada e depois fica nítida.
Tudo isto funciona no Coprocessador Apple Matrix, ou AMX, uma unidade de cálculo dedicada incorporada em chips Apple Silicon como a série A e a série M. O AMX lida com o cálculo intensivo de números sem drenar o processador principal ou a bateria.
Por que é importante que tudo permaneça no dispositivo?
A resposta curta é privacidade. Como a síntese de áudio acontece inteiramente no dispositivo, a sua voz e o que a Siri lhe diz nunca viajam para os servidores da Apple. Não há nada para intercepção, armazenamento ou citação judicial. Para utilizadores que se preocuparam com assistentes de voz a escutarem, esta arquitetura é uma escolha de design significativa, não apenas uma afirmação de marketing.
O desempenho é o outro benefício. O processamento local significa sem esperar por uma viagem de ida e volta para um servidor distante. A resposta de voz começa quase imediatamente.
| Componente | Função | Funciona em |
|---|---|---|
| AFM 3 Core Advanced | Gera tokens de áudio semânticos a partir de texto | No dispositivo |
| Detokenizador | Converte tokens em formas de onda de áudio | Chip Apple AMX |
| Representação RVQ | Aguça e coloca em camadas detalhe de áudio | No dispositivo |
O que significa isto para utilizadores comuns?
Se o seu dispositivo suporta a funcionalidade, a Siri simplesmente soa melhor. Não precisa alterar uma definição ou participar em nada. A melhoria chega através de uma atualização de software.
O sinal mais amplo é que a Apple está a empurrar capacidade séria de IA para o chip em vez de depender de servidores na nuvem. Essa abordagem prioriza privacidade e velocidade em conjunto, e este motor de áudio é um dos exemplos mais claros até agora do que isso parece na prática.



