L'IA vocale aperta di NVIDIA parla ora 12 lingue e risponde in meno di un decimo di secondo
Una nuova versione del modello text-to-speech Magpie di NVIDIA aggiunge arabo, coreano e portoghese brasiliano, e funziona abbastanza velocemente sul vostro hardware per mantenere gli assistenti vocali naturali.

Punti chiave
- NVIDIA Magpie Multilingual TTS, un modello text-to-speech open-weights gratuito, ora supporta 12 lingue dopo aver aggiunto arabo, coreano e portoghese brasiliano nell'ultimo rilascio.
- Sul chip più veloce attuale di NVIDIA, il B200, il modello produce il primo audio parlato in soli 32 millisecondi, ben al di sotto della soglia in cui gli umani notano un ritardo.
- Gli sviluppatori possono scaricare ed eseguire il modello interamente sui propri computer o server, senza che nessun dato venga inviato al cloud di NVIDIA.
- Il tasso di errore dei caratteri francesi, una misura di quanto accuratamente il modello pronuncia le parole, è sceso dal 2,70% all'1,54% rispetto alla versione precedente.
- L'architettura del modello e i benchmark sono documentati in un articolo accettato da ICASSP 2026, una delle principali conferenze di ricerca audio.
Quando fai una domanda a un assistente vocale, un piccolo orologio inizia a ticchettare nel momento in cui smetti di parlare. Le tue parole vengono trascritte, un'IA elabora una risposta e poi un motore text-to-speech, software che legge il testo scritto ad alta voce con una voce sintetica, trasforma quella risposta in suono. L'ultimo passaggio è quello che le tue orecchie giudicano più duramente. Se la voce impiega troppo tempo per iniziare a parlare, l'intera conversazione sembra lenta.
NVIDIA vuole risolvere questo problema con Magpie Multilingual TTS, un modello text-to-speech che sta rilasciando come open weights, il che significa che i file del modello completamente addestrato sono gratuiti da scaricare ed eseguire ovunque. L'ultimo aggiornamento, descritto per la prima volta su Hugging Face, espande il modello a 12 lingue e migliora il suo suono naturale in diverse lingue esistenti.
Cosa ha effettivamente cambiato NVIDIA?
Arrivano tre nuove lingue: arabo standard moderno, coreano e portoghese brasiliano, portando il totale a 12. Il modello ha 364 milioni di parametri, una misura approssimativa della sua complessità, e gestisce tutte e 12 le lingue in un unico download anziché richiedere un modello separato per lingua.
La qualità è anche migliorata notevolmente per le lingue esistenti. La precisione della pronuncia francese si è affinata notevolmente e lo spagnolo ha seguito da vicino.
| Lingua | Tasso di errore prima | Tasso di errore ora | Corrispondenza voce prima | Corrispondenza voce ora |
|---|---|---|---|---|
| Francese | 2,70% | 1,54% | 0,703 | 0,747 |
| Spagnolo | 1,14% | 0,60% | 0,715 | 0,793 |
| Tedesco | 0,66% | 0,80% | 0,626 | 0,742 |
Fonte: Magpie TTS Multilingual model card. Un tasso di errore più basso è migliore; un punteggio di corrispondenza voce più alto è migliore.
Quanto velocemente parla effettivamente?
Abbastanza veloce che la maggior parte delle persone non noterà una pausa. Su un chip NVIDIA B200, del tipo che si trova nei data centre di fascia alta, il modello inizia a produrre audio 32 millisecondi dopo aver ricevuto il testo. È circa un trentesimo di secondo. Anche su un NVIDIA A100, un chip più vecchio e più ampiamente distribuito, il primo ritardo audio è di 79 millisecondi.
Per il contesto, gli umani iniziano a percepire una conversazione come imbarazzante quando le risposte richiedono più di circa 200 millisecondi. Il passaggio del parlato di Magpie lascia la maggior parte di quel budget libero per le altre parti della pipeline.
Due scelte di ingegneria guidano la velocità. In primo luogo, il modello prevede due blocchi audio contemporaneamente invece di uno durante ogni fase di elaborazione, dimezzando il numero di passaggi necessari. In secondo luogo, una piccola rete aggiuntiva chiamata local transformer pulisce qualsiasi perdita di qualità derivante dal fare due blocchi alla volta, mantenendo la voce naturale.
Perché è importante eseguirlo da soli?
La maggior parte dei servizi text-to-speech commerciali sono basati su cloud: il tuo testo viaggia verso un server remoto, viene convertito in audio e viaggia indietro. Ogni uno di questi viaggi costa tempo e significa che una terza parte gestisce i tuoi dati.
Poiché i pesi di Magpie sono aperti, un ospedale, una banca o qualsiasi organizzazione con regole sulla privacy rigorose può eseguire il modello sui propri server. L'audio non esce mai dall'edificio. Gli sviluppatori possono anche mettere a punto il modello sui propri campioni vocali o vocabolario specializzato, cosa che un'API commerciale bloccata non permetterà.
Per gli utenti quotidiani, l'effetto pratico sono gli assistenti vocali nelle app costruite su Magpie che si sentono più responsivi e possono gestire più lingue senza che lo sviluppatore paghi commissioni per carattere a un provider cloud.



