NVIDIAs kostenlose, offene Voice-AI spricht nun 12 Sprachen und antwortet in unter einer Zehntel Sekunde

Eine neue Version von NVIDIAs Magpie-Texte-zu-Sprache-Modell fügt Arabisch, Koreanisch und brasilianisches Portugiesisch hinzu und läuft schnell genug auf Ihrer eigenen Hardware, um Voice-Assistenten natürlich wirken zu lassen.

AI2Day Newsdesk4 min read
A vast server room filled with rows of illuminated blue and white rack-mounted computers stretching into the distance, cool dramatic lighting reflecting off pol
Share

Wichtigste Punkte

  • NVIDIA Magpie Multilingual TTS, ein kostenloses Open-Weights-Modell zur Umwandlung von Text in Sprache, unterstützt nun 12 Sprachen, nachdem Arabisch, Koreanisch und brasilianisches Portugiesisch in der neuesten Version hinzugefügt wurden.
  • Auf NVIDIAs schnellstem aktuellem Chip, dem B200, erzeugt das Modell die erste Sprachausgabe in nur 32 Millisekunden, weit unter der Schwelle, bei der Menschen eine Verzögerung bemerken.
  • Entwickler können das Modell vollständig auf ihren eigenen Computern oder Servern herunterladen und ausführen, ohne dass Daten an NVIDIAs Cloud gesendet werden.
  • Die französische Zeichenfehlerquote, ein Maß für die Genauigkeit der Aussprache des Modells, sank von 2,70 % auf 1,54 % gegenüber der vorherigen Version.
  • Die Architektur und Benchmarks des Modells sind in einem Papier dokumentiert, das zur ICASSP 2026, einer führenden Audioforschungskonferenz, angenommen wurde.

Wenn Sie einen Voice-Assistenten eine Frage stellen, beginnt eine kleine Uhr zu ticken, sobald Sie aufhören zu sprechen. Ihre Worte werden transkribiert, eine KI arbeitet eine Antwort aus, und dann wandelt ein Text-zu-Sprache-Engine, Software, die geschriebenen Text in einer synthetischen Stimme laut vorliest, diese Antwort in Ton um. Der letzte Schritt ist derjenige, den Ihre Ohren am strengsten beurteilen. Wenn die Stimme zu lange braucht, um zu sprechen, wirkt das ganze Gespräch träge.

NVIDIA möchte das mit Magpie Multilingual TTS beheben, einem Text-zu-Sprache-Modell, das als offene Gewichte veröffentlicht wird, was bedeutet, dass die vollständigen trainierten Modelldateien kostenlos heruntergeladen und überall ausgeführt werden können. Das neueste Update, das zunächst auf Hugging Face vorgestellt wurde, erweitert das Modell auf 12 Sprachen und verbessert, wie natürlich es in mehreren bestehenden klingt.

Was hat NVIDIA tatsächlich geändert?

Drei neue Sprachen werden hinzugefügt: Modernes Standardarabisch, Koreanisch und brasilianisches Portugiesisch, was die Gesamtzahl auf 12 bringt. Das Modell hat 364 Millionen Parameter, ein grobes Maß für seine Komplexität, und verarbeitet alle 12 Sprachen in einem einzigen Download, anstatt ein separates Modell pro Sprache zu erfordern.

Die Qualität verbesserte sich auch messbar für bestehende Sprachen. Die französische Aussprachegenauigkeit verschärfte sich erheblich, und Spanisch folgte dicht dahinter.

Sprache Fehlerquote vorher Fehlerquote jetzt Stimmenübereinstimmung vorher Stimmenübereinstimmung jetzt
Französisch 2,70% 1,54% 0,703 0,747
Spanisch 1,14% 0,60% 0,715 0,793
Deutsch 0,66% 0,80% 0,626 0,742

Quelle: Magpie TTS Multilingual-Modellkarte. Niedrigere Fehlerquote ist besser; höhere Stimmenübereinstimmungswerte sind besser.

Wie schnell spricht es tatsächlich?

Schnell genug, dass die meisten Menschen eine Pause nicht bemerken werden. Auf einem NVIDIA B200-Chip, wie er in High-End-Rechenzentren zu finden ist, beginnt das Modell, Audio 32 Millisekunden nach Erhalt von Text zu erzeugen. Das ist ungefähr eine Dreißigstel einer Sekunde. Selbst auf einem NVIDIA A100, einem älteren und weit verbreiteten Chip, beträgt die Verzögerung bei der ersten Audioausgabe 79 Millisekunden.

Zum Vergleich: Menschen nehmen ein Gespräch als unangenehm wahr, wenn Antworten länger als etwa 200 Millisekunden dauern. Der Sprachschritt von Magpie lässt den größten Teil dieses Budgets für die anderen Teile der Pipeline frei.

Zwei technische Entscheidungen treiben die Geschwindigkeit an. Erstens sagt das Modell während jedes Verarbeitungsschritts zwei Audio-Blöcke auf einmal voraus, anstatt einen, wodurch die Anzahl der erforderlichen Schritte halbiert wird. Zweitens bereinigt ein kleines zusätzliches Netzwerk, das einen lokalen Transformer aufruft, alle Qualitätsverluste, die sich aus dem gleichzeitigen Verarbeiten von zwei Blöcken ergeben, und hält die Stimme natürlich klingend.

Warum ist das eigenständige Ausführen wichtig?

Die meisten kommerziellen Text-zu-Sprache-Services sind Cloud-basiert: Ihr Text reist zu einem Remote-Server, wird in Audio umgewandelt und reist zurück. Jede dieser Reisen kostet Zeit und bedeutet, dass ein Dritter Ihre Daten verarbeitet.

Da Magpies Gewichte offen sind, können ein Krankenhaus, eine Bank oder jede Organisation mit strikten Datenschutzregeln das Modell auf ihren eigenen Servern ausführen. Audio verlässt niemals das Gebäude. Entwickler können das Modell auch auf ihren eigenen Sprachsamples oder spezialisiertem Vokabular feinabstimmen, was eine gesperrte kommerzielle API nicht zulässt.

Für alltägliche Nutzer besteht die praktische Auswirkung darin, dass Voice-Assistenten in Apps, die auf Magpie basieren, reaktionsschneller wirken und mehr Sprachen verarbeiten können, ohne dass der Entwickler gebühren pro Zeichen an einen Cloud-Provider zahlt.

© 2026 AI2Day