La nouvelle technologie vocale IA d'Apple améliore le son de Siri, sans envoyer vos données audio au cloud
Un document de recherche de l'équipe d'apprentissage automatique d'Apple révèle le moteur audio derrière les nouvelles voix expressives de Siri. Tout le traitement se fait sur votre iPhone, en utilisant une puce que vous possédez déjà.

Points clés
- Le modèle AFM 3 Core Advanced d'Apple, l'IA sur appareil la plus performante de l'entreprise, alimente désormais la nouvelle fonctionnalité Siri Voix expressives.
- Tout l'audio est généré et traité directement sur l'appareil, ce qui signifie qu'aucune donnée vocale n'est envoyée aux serveurs d'Apple.
- Le système fonctionne sur le coproc processeur Apple Matrix, une unité de traitement spécialisée intégrée aux puces propres d'Apple.
- Une nouvelle architecture audio convertit les jetons audio compressés en parole naturelle et complète en temps réel.
- Apple ML Research a publié la recherche sous-jacente, détaillant comment les limites de mémoire strictes d'un téléphone ont été surmontées.
Quand Siri vous parle, cela sonne maintenant sensiblement plus naturel. Ce n'est pas une coïncidence. Apple a discrètement déployé un nouveau système sophistiqué de génération audio, et un document publié par Apple ML Research explique exactement comment il fonctionne.
La fonctionnalité s'appelle Siri Voix expressives. Elle utilise un processus appelé synthèse audio, où un logiciel génère des paroles à partir de rien plutôt que d'assembler des clips préenregistrés. Imaginez-le comme un moteur de synthèse vocale très avancé, sauf qu'au lieu de sonner robotique, le résultat est riche et configurable en temps réel.
Comment cela fonctionne-t-il réellement ?
Le système convertit le texte en parole en deux étapes. Premièrement, un grand modèle de langage appelé AFM 3 Core Advanced, un type d'IA qui comprend et génère le langage, produit des paquets compacts d'informations audio appelés jetons sémantiques. Ce ne sont pas encore des sons. C'est plutôt un raccourci compressé pour ce que l'audio devrait être.
Un deuxième composant, appelé le détokeniseur, déplie ensuite ces jetons en véritables ondes sonores que vous pouvez entendre. Le document décrit cette deuxième étape en détail, car c'est la partie véritablement difficile.
La difficulté est la mémoire. Les téléphones ont des limites strictes sur la quantité de mémoire que le logiciel peut utiliser à tout moment. Pour insérer la génération audio haute qualité dans ces limites, les ingénieurs d'Apple ont conçu une architecture en trois parties qui convertit les jetons simples en un format audio plus riche appelé RVQ, ce qui signifie quantification vectorielle résiduelle. Pensez à RVQ comme une série d'instructions audio en couches qui affinent progressivement la qualité du son, similaire à la façon dont une image JPEG se charge floue puis s'affine.
Tout cela s'exécute sur le coproc processeur Apple Matrix, ou AMX, une unité de calcul dédiée intégrée aux puces Apple Silicon comme les séries A et M. L'AMX gère les calculs intensifs sans décharger le processeur principal ou la batterie.
Pourquoi est-il important que tout reste sur l'appareil ?
La réponse courte est la confidentialité. Comme la synthèse audio se fait entièrement sur l'appareil, votre voix et ce que Siri dit en retour ne se rendent jamais aux serveurs d'Apple. Il n'y a rien à intercepter, stocker ou citer à comparaître. Pour les utilisateurs qui se sont inquiétés des assistants vocaux qui écoutent, cette architecture est un véritable choix de conception, pas seulement une affirmation marketing.
La performance est l'autre avantage. Le traitement local signifie pas d'attente pour un aller-retour vers un serveur distant. La réponse vocale commence presque immédiatement.
| Composant | Rôle | S'exécute sur |
|---|---|---|
| AFM 3 Core Advanced | Génère les jetons audio sémantiques à partir du texte | Sur l'appareil |
| Détokeniseur | Convertit les jetons en formes d'onde audio | Puce Apple AMX |
| Représentation RVQ | Affine et superpose les détails audio | Sur l'appareil |
Que signifie cela pour les utilisateurs ordinaires ?
Si votre appareil prend en charge la fonctionnalité, Siri sonne simplement mieux. Vous n'avez besoin de modifier aucun paramètre ou de vous inscrire à quoi que ce soit. L'amélioration arrive via une mise à jour logicielle.
Le signal plus large est qu'Apple pousse des capacités IA sérieuses dans la puce plutôt que de s'appuyer sur des serveurs cloud. Cette approche privilégie la confidentialité et la vitesse ensemble, et ce moteur audio est l'un des exemples les plus clairs à ce jour de ce que cela ressemble dans la pratique.



