Fish Audio lève 50 millions de dollars pour permettre à chacun de cloner une voix, mais les questions de consentement persistent
La startup de Palo Alto compte 8 millions d'utilisateurs et 21 millions de dollars de revenus annuels. Son nouveau financement lui permettra de se lancer dans les contrats d'entreprise et les modèles plus avancés. Une controverse récente concernant des téléchargements de voix non autorisés n'est pas entièrement résolue.

Points clés
- Fish Audio a clôturé un tour de financement seed de 50 millions de dollars mardi, mené par Coreline Ventures et Capital Today.
- La startup a déclaré un revenu récurrent annuel de 21 millions de dollars et plus de 8 millions d'utilisateurs en cette semaine.
- La bibliothèque de voix de Fish Audio a été construite en partie à partir d'enregistrements soumis par des utilisateurs, dont certains ont été téléchargés sans le consentement des créateurs originaux.
- L'entreprise a automatisé son processus de suppression de voix, promettant un retrait en moins de trois minutes après une plainte vérifiée.
- Fish Audio prévoit de lancer un modèle de compréhension audio et un modèle de parole à parole avant la fin de 2025.
Une startup de Palo Alto qui permet aux développeurs et aux créateurs de jeux de générer des voix synthétiques réalistes a sécurisé une importante injection de financement en phase de démarrage, confirmant l'appétit solide des investisseurs pour la technologie vocale IA, même si le secteur se débat avec des questions épineuses sur l'appartenance des voix.
Fish Audio a annoncé mardi qu'elle levait 50 millions de dollars dans un tour de financement seed, le type de financement initial qui intervient généralement avant qu'une entreprise n'ait fait ses preuves à grande échelle. Coreline Ventures et Capital Today ont mené le tour, avec la participation de 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners et HF0.
Que fait réellement Fish Audio ?
L'entreprise construit des modèles de synthèse vocale, des logiciels qui convertissent les mots écrits en audio parlé, en mettant l'accent sur l'expressivité et le contrôle fin. Sa bibliothèque offre plus de 15 000 contrôles en langage naturel, permettant à un développeur d'écrire une instruction comme « sonner nerveux mais rassurant » plutôt que d'ajuster des curseurs techniques.
Fish Audio a lancé cinq modèles au cours de l'année passée : quatre modèles de génération de parole et un modèle de parole-texte, qui fait l'inverse et convertit l'audio en texte écrit. Trois des modèles de parole sont open-source, ce qui signifie que n'importe qui peut télécharger et utiliser le code librement. Son dernier modèle, S2.1 Pro, est disponible uniquement via une API payante, une interface de programmation qui permet à d'autres applications de se connecter à la technologie de Fish Audio.
L'entreprise remonte ses racines à un projet secondaire du chercheur ancien de Nvidia Shijia Liao. Frustré par le son robotique des voix synthétiques, il a entraîné un modèle sur un GPU unique, la puce spécialisée qui effectue les calculs intensifs que l'IA exige, et a publié le code publiquement. Ce référentiel a depuis reçu plus de 31 000 stars sur GitHub, une mesure approximative de l'intérêt des développeurs.
Aujourd'hui, les clients payants incluent HeyGen, qui alimente les avatars IA, et les plateformes d'agents vocaux d'entreprise. Fish Audio génère 21 millions de dollars en revenu récurrent annuel, d'abord signalé par TechCrunch.
Les créateurs devraient-ils craindre que leurs voix soient utilisées sans permission ?
Peut-être, oui. Plus tôt cette année, certains artistes ont allégué que leurs voix apparaissaient sur la plateforme de Fish Audio sans leur consentement. La stratégie de croissance de Fish Audio implique de demander aux utilisateurs de soumettre des voix pour l'entraînement du modèle et de rémunérer les contributeurs lorsque leurs enregistrements sont utilisés. Cette confiance s'est fissurée.
L'entreprise a depuis automatisé son processus de suppression DMCA. DMCA, le Digital Millennium Copyright Act, est une loi américaine qui offre aux créateurs un mécanisme formel pour exiger la suppression de leur matériel protégé par le droit d'auteur des plates-formes en ligne. La PDG Rissa Cao a déclaré à TechCrunch qu'une plainte vérifiée déclenche désormais une suppression en moins de trois minutes.
L'écart dans le processus reste réel, cependant. Rien n'empêche quelqu'un de télécharger la voix d'une autre personne sans sa connaissance, et la voix reste en ligne jusqu'à ce que le créateur affecté la découvre et dépose une plainte. C'est le même problème structurel que nous avons signalé dans la violation de Suno plus tôt cette année : une suppression plus rapide aide, mais cela ne traite pas la façon dont le matériel y est arrivé en premier lieu.
Oskue Honda, associé chez l'investisseur principal Coreline Ventures, a reconnu le problème directement : « Le consentement, la transparence et l'attribution doivent être intégrés au produit plutôt que traités comme des arrière-pensées. »
Que se passe-t-il ensuite ?
Fish Audio utilisera le financement pour développer des modèles plus avancés et attirer de plus grands clients d'entreprise. Deux nouveaux produits sont en préparation pour 2025 : un modèle de compréhension audio, qui interpréterait le sens et le contenu des clips audio, et un modèle de parole à parole qui convertit une voix parlée en une autre en temps réel.
Le marché est encombré. ElevenLabs, WellSaid, Cartesia et Speechify se disputent tous les mêmes développeurs et budgets commerciaux. L'argument de Fish Audio est qu'elle peut égaler la qualité de première ligne à un coût inférieur, en partie parce que son équipe de fondation allégée a maintenu les dépenses d'entraînement basses.
Pour les utilisateurs ordinaires, le résultat pratique est simple : recherchez votre nom ou votre voix sur n'importe quelle plateforme audio IA pour laquelle vous ne vous êtes pas explicitement inscrit. Si vous trouvez quelque chose, la plupart des plates-formes ont maintenant un itinéraire de suppression, et celui de Fish Audio est désormais plus rapide que la plupart.
Questions fréquemment posées
Une entreprise peut-elle légalement utiliser votre voix pour entraîner une IA sans vous le demander ?
Dans la plupart des juridictions, non. Le droit d'auteur et, dans certains États américains, les statuts de droit à la publicité donnent aux individus le contrôle sur l'utilisation commerciale de leur voix. Le paysage juridique évolue toujours, mais le téléchargement de la voix de quelqu'un d'autre sans consentement comporte déjà un risque réel pour le téléchargeur.
Qu'est-ce qu'un tour de financement seed, et pourquoi 50 millions de dollars semblent-ils importants pour cela ?
Un tour de financement seed est le premier investissement extérieur formel qu'une startup entreprend, généralement utilisé pour construire un produit et embaucher du personnel. Cinquante millions de dollars est exceptionnellement important à ce stade, reflétant la quantité de concurrence qu'il y a pour soutenir les entreprises d'infrastructure IA avant qu'elles n'atteignent les tours de financement ultérieurs et plus coûteux.



