Fish Audio recauda $50 millones para clonar voces, pero persisten dudas sobre consentimiento

La startup de Palo Alto tiene 8 millones de usuarios y $21 millones en ingresos anuales. Su nueva financiación impulsará contratos empresariales y modelos más avanzados. Una controversia reciente sobre cargas de voz no autorizadas aún no se ha resuelto completamente.

AI2Day NewsdeskUpdated Editor: Lee Brown4 min read
A sleek modern corporate office interior at dusk, glass walls reflecting city lights, an empty executive chair at a large curved desk with a glowing monitor sho
Share

Puntos clave

  • Fish Audio cerró una ronda de semilla de $50 millones el martes, liderada por Coreline Ventures y Capital Today.
  • La startup reportó $21 millones en ingresos recurrentes anuales y más de 8 millones de usuarios a partir de esta semana.
  • La biblioteca de voces de Fish Audio se construyó en parte a partir de grabaciones enviadas por usuarios, algunas de las cuales se cargaron sin el consentimiento de los creadores originales.
  • La empresa automatizó su proceso de eliminación de voces, prometiendo la eliminación en menos de tres minutos después de una reclamación verificada.
  • Fish Audio planea lanzar un modelo de comprensión de audio y un modelo de conversión de voz a voz antes de finales de 2025.

Una startup de Palo Alto que permite a desarrolladores y diseñadores de videojuegos generar voces sintéticas realistas ha asegurado una gran inyección de financiación en etapa temprana, confirmando un sólido apetito inversor por la tecnología de voz con IA, incluso mientras el sector lidia con preguntas espinosas sobre a quién pertenece la voz.

Fish Audio anunció el martes que recaudó $50 millones en una ronda de semilla, el tipo de financiación temprana que generalmente llega antes de que una empresa se pruebe a escala. Coreline Ventures y Capital Today lideraron la ronda, con 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners y HF0 también participando.

¿Qué hace exactamente Fish Audio?

La empresa construye modelos de conversión de texto a voz, software que convierte palabras escritas en audio hablado, con énfasis en la expresividad y el control fino. Su biblioteca ofrece más de 15,000 controles de lenguaje natural, permitiendo que un desarrollador escriba una instrucción como "sonar nervioso pero tranquilizador" en lugar de ajustar controles técnicos.

Fish Audio lanzó cinco modelos en el año pasado: cuatro modelos de generación de voz y un modelo de conversión de voz a texto, que hace lo inverso y convierte audio en texto escrito. Tres de los modelos de voz son de código abierto, lo que significa que cualquiera puede descargar y usar el código libremente. Su modelo más reciente, S2.1 Pro, está disponible solo a través de una API de pago, una interfaz de programación que permite que otras aplicaciones se conecten a la tecnología de Fish Audio.

La empresa tiene sus raíces en un proyecto secundario del antiguo investigador de Nvidia Shijia Liao. Frustrado por lo robótico que sonaban las voces sintéticas, entrenó un modelo en una única GPU, el chip especializado que realiza los cálculos numéricos pesados que requiere la IA, y publicó el código públicamente. Ese repositorio ha acumulado más de 31,000 estrellas en GitHub, una medida aproximada del interés de los desarrolladores.

Hoy, los clientes que pagan incluyen HeyGen, que potencia avatares de IA, y plataformas de agentes de voz empresariales. Fish Audio genera $21 millones en ingresos recurrentes anuales, reportado por primera vez por TechCrunch.

¿Deberían los creadores preocuparse de que sus voces se usen sin permiso?

Posiblemente, sí. A principios de este año, algunos artistas alegaron que sus voces aparecían en la plataforma de Fish Audio sin su consentimiento. La estrategia de crecimiento de Fish Audio implica pedir a los usuarios que envíen voces para entrenar modelos y compensar a los colaboradores cuando se utilizan sus grabaciones. Esa confianza se resquebrajó.

La empresa ha automatizado desde entonces su proceso de retirada DMCA. DMCA, la Ley de Derechos de Autor del Milenio Digital, es una ley estadounidense que otorga a los creadores una ruta formal para exigir la eliminación de su material con derechos de autor de plataformas en línea. La CEO Rissa Cao le dijo a TechCrunch que una queja verificada ahora desencadena la eliminación en menos de tres minutos.

La brecha en el proceso sigue siendo real. Nada impide que alguien cargue la voz de otra persona sin su conocimiento, y la voz permanece activa hasta que el creador afectado la descubre y presenta una reclamación. Es el mismo problema estructural que reportamos en el incidente de seguridad de Suno a principios de este año: la eliminación más rápida ayuda, pero no aborda cómo llegó el material en primer lugar.

Oskue Honda, socio del inversor principal Coreline Ventures, reconoció el problema directamente: "El consentimiento, la transparencia y la atribución deben integrarse en el producto en lugar de tratarse como ocurrencias tardías".

¿Qué sucede ahora?

Fish Audio utilizará la financiación para desarrollar modelos más avanzados y atraer a clientes empresariales más grandes. Dos nuevos productos están en la hoja de ruta para 2025: un modelo de comprensión de audio, que interpretaría el significado y contenido de clips de audio, y un modelo de conversión de voz a voz que convierte una voz hablada en otra en tiempo real.

El mercado es concurrido. ElevenLabs, WellSaid, Cartesia y Speechify compiten por los mismos desarrolladores y presupuestos empresariales. El argumento de Fish Audio es que puede igualar la calidad líder a un costo menor, en parte porque su pequeño equipo fundador ha mantenido los gastos de entrenamiento bajos.

Para usuarios ordinarios, la conclusión práctica es directa: busca tu nombre o voz en cualquier plataforma de audio con IA en la que no te hayas registrado explícitamente. Si encuentras algo, la mayoría de las plataformas ahora tienen una ruta de retirada, y la de Fish Audio ahora es más rápida que la mayoría.

Preguntas frecuentes

¿Puede una empresa usar legalmente tu voz para entrenar una IA sin pedirte permiso?

En la mayoría de las jurisdicciones, no. La ley de derechos de autor y, en algunos estados estadounidenses, las leyes de derechos de publicidad otorgan a los individuos control sobre el uso comercial de su voz. El panorama legal aún está evolucionando, pero cargar la voz de alguien más sin consentimiento ya conlleva riesgo real para quien carga.

¿Qué es una ronda de semilla y por qué $50 millones suenan como mucho para una?

Una ronda de semilla es la primera inversión externa formal que realiza una startup, generalmente se utiliza para desarrollar productos y contratar personal. Cincuenta millones de dólares es inusualmente grande en esta etapa, reflejando cuánta competencia hay para respaldar a empresas de infraestructura de IA antes de que lleguen a rondas de financiación posteriores más costosas.

© 2026 AI2Day