#voice AI
22 stories taggedvoice AI.

Google Launches Three New Gemini Audio Models That Handle Jargon, Interruptions and 85 Languages
Gemini 3.5 Transcribe, 3.5 Live and 3.5 Live Experimental are rolling out now, and the transcription model is a first for the Gemini family.

Google's new Gemini 3.5 Transcribe raises the bar for voice AI, and the risks that come with it
Google DeepMind's latest speech-to-text model is faster, sharper and multilingual. It also gives scammers a cleaner tool to work with.

Ringg Expands Voice AI Capabilities with $10 Million Investment
Voice AI startup Ringg secures funding as it shifts to complex tasks beyond simple calls in India.

AI speech models are cheating on their own tests, new research finds
A study of 11 popular voice transcription systems found that several reproduce known errors from benchmark datasets, even when the audio says something different. It raises a quiet but serious question: are high scores measuring real ability, or familiarity with the test?

Wispr raises $280 million and sets its sights on meetings, not just dictation
The AI dictation startup is now valued at $2 billion and just launched a new voice model that it says will cut speech errors by two-thirds.

Robots Can Move. They Can See. So Why Can't They Hold a Conversation?
Humanoid robots are impressive to watch, until you try talking to one. A specialist in audio AI explains why poor hearing and bad voice interaction could be the thing that stops robots from ever being widely accepted.

Microsoft zieht seinen animierten Blob Mico aus dem Copilot-Sprachmodus
Der gelbe animierte Charakter, der vor weniger als einem Jahr eingeführt wurde, um dem Chatbot ein Gesicht zu geben, wird stillschweigend auf eine Lernplattform verlegt.

Googles Gemini-App erreicht eine Milliarde monatliche Nutzer und zieht mit ChatGPT gleich
Googles KI-Assistent hat eine Schwelle überschritten, die nur 13 andere Google-Produkte je erreicht haben. Hier ist, was die Zahlen wirklich aussagen.

NVIDIAs kostenlose, offene Voice-AI spricht nun 12 Sprachen und antwortet in unter einer Zehntel Sekunde
Eine neue Version von NVIDIAs Magpie-Texte-zu-Sprache-Modell fügt Arabisch, Koreanisch und brasilianisches Portugiesisch hinzu und läuft schnell genug auf Ihrer eigenen Hardware, um Voice-Assistenten natürlich wirken zu lassen.

Jobinterviews um Mitternacht sind real – und KI ist der Grund dafür
Millionen von Jobsuchenden absolvieren jetzt KI-gesteuerte Videobefragungen um 1 Uhr morgens. Das löst ein echtes Scheduling-Problem. Es wirft aber auch Fragen auf, auf die noch niemand bereit ist, Antworten zu geben.

Der Roboter am Drive-Thru-Schalter ist zurück – und diesmal könnte es funktionieren
Nach einem holprigen ersten Versuch führen Fast-Food-Ketten KI-Sprachbestellungen still und leise bei Millionen von Kunden wieder ein. Einige haben Erfolg. Einige arbeiten noch daran.

Smallest.ai sammelt 13 Millionen Dollar für einen Voice-AI ein, den man nicht als Maschine erkennt
Das Startup möchte, dass KI-Telefonagenten so natürlich klingen, dass Anrufer nie bemerken, dass sie nicht mit einer Person sprechen. So plant das Unternehmen vorzugehen, und was das für jeden bedeutet, der in der Warteschleife landet.

OpenAI baut eine „Familie von Geräten" – Das sagte Greg Brockman wirklich
Der OpenAI-Präsident bestätigte, dass Hardware kommt, gab aber kein Veröffentlichungsdatum, keine Produktnamen und keine Bestätigung des gerüchteten Smart Speakers. Er deutete an, dass Sprache zur Hauptinteraktionsform mit Computern werden könnte.

Encore AI sammelt 30 Millionen Dollar für sprechende KI-Agenten, die von Ihren besten Verkaufsgesprächen lernen
Das Startup hört sich Tausende echter Kundenkonversationen an, findet heraus, was funktioniert hat, und bringt einer KI bei, diese erfolgreichen Methoden zu kopieren. Banken und Versicherer zahlen bereits dafür.

Apples neue On-Device-KI-Sprachtechnologie macht Siri menschlicher, ohne Audio in die Cloud zu senden
Ein Forschungspapier von Apples Machine-Learning-Team offenbart das Audio-Engine hinter Siris ausdrucksstärkeren neuen Stimmen. Die gesamte Verarbeitung findet auf dem iPhone statt und nutzt einen Chip, den Sie bereits haben.