Fish Audio recolhe $50 milhões para permitir a clonagem de voz por qualquer um, mas questões de consentimento persistem
A startup de Palo Alto tem 8 milhões de utilizadores e $21 milhões em receita anual. O novo financiamento vai impulsionar contratos empresariais e modelos mais avançados. Uma controvérsia recente sobre envios de voz não autorizados não foi totalmente resolvida.

Pontos-chave
- Fish Audio fechou uma ronda de financiamento inicial de $50 milhões na terça-feira, liderada pela Coreline Ventures e Capital Today.
- A startup reportou $21 milhões em receita anual recorrente e mais de 8 milhões de utilizadores a partir desta semana.
- A biblioteca de vozes da Fish Audio foi construída em parte com gravações enviadas por utilizadores, algumas das quais foram carregadas sem o consentimento dos criadores originais.
- A empresa automatizou o seu processo de remoção de vozes, prometendo remoção em menos de três minutos após uma reclamação verificada.
- Fish Audio planeia lançar um modelo de compreensão de áudio e um modelo de conversão de fala antes do final de 2025.
Uma startup de Palo Alto que permite a programadores e designers de jogos gerar vozes sintéticas realistas obteve uma injeção significativa de financiamento na fase inicial, confirmando um forte apetite dos investidores pela tecnologia de voz com IA, mesmo quando o setor enfrenta questões complexas sobre a quem pertence a voz.
Fish Audio anunciou terça-feira que recolheu $50 milhões numa ronda de financiamento inicial, o tipo de financiamento precoce que normalmente surge antes de uma empresa ter provado o seu valor em larga escala. Coreline Ventures e Capital Today lideraram a ronda, com 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners e HF0 também a participar.
O que é que Fish Audio faz exatamente?
A empresa constrói modelos de conversão de texto em fala, software que converte palavras escritas em áudio falado, com foco em expressividade e controle refinado. A sua biblioteca oferece mais de 15.000 controlos em linguagem natural, permitindo a um programador escrever uma instrução como "soar nervoso mas tranquilizador" em vez de ajustar cursores técnicos.
Fish Audio lançou cinco modelos no ano passado: quatro modelos de geração de fala e um modelo de conversão de fala em texto, que faz o oposto e converte áudio em texto escrito. Três dos modelos de fala são código aberto, o que significa que qualquer pessoa pode descarregar e usar o código livremente. O seu modelo mais recente, S2.1 Pro, está disponível apenas através de uma API paga, uma interface de programação que permite que outras aplicações se conectem à tecnologia da Fish Audio.
A empresa tem as suas origens num projeto secundário de Shijia Liao, antigo investigador da Nvidia. Frustrado por como as vozes sintéticas soavam artificiais, treinou um modelo num único GPU, o chip especializado que faz o cálculo intensivo que a IA requer, e publicou o código publicamente. Esse repositório acumulou desde então mais de 31.000 estrelas no GitHub, uma medida aproximada do interesse dos programadores.
Hoje, os clientes pagantes incluem HeyGen, que fornece avatares de IA, e plataformas empresariais de agentes de voz. Fish Audio gera $21 milhões em receita anual recorrente, informado pela primeira vez pela TechCrunch.
Deverão os criadores estar preocupados com o facto das suas vozes serem utilizadas sem autorização?
Possivelmente, sim. No início deste ano, alguns artistas alegaram que as suas vozes apareciam na plataforma da Fish Audio sem o seu consentimento. A estratégia de crescimento da Fish Audio envolve pedir aos utilizadores que enviem vozes para treino de modelos e compensar os contribuidores quando as suas gravações são utilizadas. Essa confiança desmoronou-se.
A empresa automatizou desde então o seu processo de remoção segundo a DMCA. DMCA, a Lei de Direitos Autorais do Milénio Digital, é uma lei americana que dá aos criadores uma rota formal para exigir a remoção do seu material protegido por direitos autorais de plataformas online. A CEO Rissa Cao disse à TechCrunch que uma reclamação verificada agora desencadeia remoção em menos de três minutos.
A lacuna no processo continua real, no entanto. Nada impede que alguém carregue a voz de outra pessoa sem o seu conhecimento, e a voz permanece ativa até que a pessoa afetada a descubra e apresente uma reclamação. É o mesmo problema estrutural que reportámos no vazamento de dados da Suno no início deste ano: a remoção mais rápida ajuda, mas não resolve como o material chegou lá em primeiro lugar.
Oskue Honda, parceiro do investidor principal Coreline Ventures, reconheceu o problema diretamente: "Consentimento, transparência e atribuição devem estar incorporados no produto e não ser tratados como aspetos secundários."
O que acontece a seguir?
Fish Audio utilizará o financiamento para desenvolver modelos mais avançados e conquistar clientes empresariais maiores. Dois novos produtos estão no plano para 2025: um modelo de compreensão de áudio, que interpretaria o significado e conteúdo de clips de áudio, e um modelo de conversão de fala em fala que converte uma voz falada noutra em tempo real.
O mercado é concorrido. ElevenLabs, WellSaid, Cartesia e Speechify competem pelos mesmos programadores e orçamentos empresariais. O argumento da Fish Audio é que consegue igualar a qualidade dos líderes a um custo menor, em parte porque a sua pequena equipa fundadora manteve as despesas de treino baixas.
Para utilizadores comuns, a implicação prática é direta: procure o seu nome ou voz em qualquer plataforma de áudio com IA na qual não se tenha explicitamente inscrito. Se encontrar algo, a maioria das plataformas agora tem uma rota de remoção, e a da Fish Audio é agora mais rápida do que a maioria.
Perguntas frequentes
Pode uma empresa utilizar legalmente a sua voz para treinar uma IA sem lhe pedir?
Na maioria das jurisdições, não. A lei de direitos autorais e, em alguns estados dos EUA, estatutos de direito de personalidade dão aos indivíduos controlo sobre o uso comercial da sua voz. O panorama legal ainda está a evoluir, mas carregar a voz de alguém sem consentimento já representa um risco real para quem o faz.
O que é uma ronda de financiamento inicial e por que é que $50 milhões parece elevado para uma?
Uma ronda de financiamento inicial é o primeiro investimento externo formal que uma startup recebe, normalmente utilizado para construir produto e contratar pessoal. Cinquenta milhões de dólares é invulgarmente elevado nesta fase, refletindo a quantidade de competição que existe para apoiar empresas de infraestrutura de IA antes de atingirem rondas de financiamento posteriores e mais caras.



