Fish Audio recauda $50 millones para permitir que cualquiera clone una voz, pero persisten dudas sobre el consentimiento

La startup de Palo Alto tiene 8 millones de usuarios e ingresos recurrentes anuales de $21 millones. Su nueva financiación impulsará contratos empresariales y modelos más avanzados. Una controversia reciente sobre carga de voces no autorizada no se ha resuelto completamente.

AI2Day Newsdesk4 min read
A sleek modern corporate office interior at dusk, glass walls reflecting city lights, an empty executive chair at a large curved desk with a glowing monitor sho
Share

Puntos clave

  • Fish Audio cerró una ronda de inversión inicial de $50 millones el martes, liderada por Coreline Ventures y Capital Today.
  • La startup reportó $21 millones en ingresos recurrentes anuales y más de 8 millones de usuarios esta semana.
  • La biblioteca de voces de Fish Audio se construyó en parte a partir de grabaciones enviadas por usuarios, algunas de las cuales se cargaron sin el consentimiento de los creadores originales.
  • La empresa automatizó su proceso de eliminación de voces, prometiendo su retiro en menos de tres minutos tras una reclamación verificada.
  • Fish Audio planea lanzar un modelo de comprensión de audio y un modelo de conversión de voz a voz antes de finales de 2025.

Una startup de Palo Alto que permite a desarrolladores, diseñadores de videojuegos y empresas generar voces sintéticas realistas acaba de asegurar una gran inyección de financiación en etapa inicial, confirmando un fuerte apetito inversor por la tecnología de voz con IA incluso mientras el sector lucha con difíciles preguntas sobre quién es dueño de cada voz.

Fish Audio anunció el martes que recaudó $50 millones en una ronda inicial, el tipo de financiación temprana que típicamente llega antes de que una empresa se haya probado a escala. Coreline Ventures y Capital Today lideraron la ronda, con la participación también de 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners y HF0.

¿Qué es lo que realmente hace Fish Audio?

La empresa construye modelos de texto a voz, software que convierte palabras escritas en audio hablado, con énfasis en la expresividad y el control fino. Su biblioteca ofrece más de 15.000 controles de lenguaje natural, lo que significa que un desarrollador puede escribir una instrucción como "suena nervioso pero tranquilizador" en lugar de ajustar controles técnicos.

Fish Audio lanzó cinco modelos en el último año: cuatro modelos de generación de voz y uno de conversión de voz a texto, que hace lo inverso y convierte audio en texto escrito. Tres de los modelos de voz son de código abierto, lo que significa que cualquiera puede descargar y usar el código libremente. Su último modelo, S2.1 Pro, está disponible solo a través de una API de pago, una interfaz de programación que permite que otras aplicaciones se conecten a la tecnología de Fish Audio.

La empresa tiene sus raíces en un proyecto paralelo del anterior investigador de Nvidia Shijia Liao. Frustrado por lo robótico que sonaban las voces sintéticas, entreno un modelo en una sola GPU, el chip especializado que realiza el cálculo numérico intensivo que requiere la IA, y publicó el código públicamente. Ese repositorio ha acumulado desde entonces más de 31.000 estrellas en GitHub, una medida aproximada del interés de los desarrolladores.

Hoy, los clientes pagos incluyen HeyGen, que potencia avatares de IA, y plataformas empresariales de agentes de voz. Fish Audio genera $21 millones en ingresos recurrentes anuales, información reportada primero por TechCrunch.

¿Deberían preocuparse los creadores por el uso de sus voces sin permiso?

Posiblemente, sí. A principios de este año, algunos artistas alegaron que sus voces aparecían en la plataforma de Fish Audio sin su consentimiento. Parte de la estrategia de crecimiento de Fish Audio implica pedir a los usuarios que envíen voces para entrenamiento de modelos, compensando a los contribuyentes cuando se utilizan sus grabaciones. El sistema se basa en la confianza, y esa confianza se resquebrajó.

La empresa desde entonces automatizó su proceso de retirada conforme a la DMCA. DMCA, la Ley de Derechos de Autor del Milenio Digital, es una ley de EE.UU. que otorga a los creadores una ruta formal para exigir la eliminación de su material protegido por derechos de autor de plataformas en línea. La directora ejecutiva Rissa Cao dice que una reclamación verificada ahora desencadena la eliminación en menos de tres minutos.

La brecha en el proceso sigue siendo real, sin embargo. Nada detiene a alguien de cargar la voz de otra persona sin su conocimiento. La voz permanece activa hasta que el creador afectado la descubre y presenta una reclamación.

Oskue Honda, socio del inversor principal Coreline Ventures, reconoció el problema directamente: "El consentimiento, la transparencia y la atribución deben estar integrados en el producto en lugar de ser tratados como ocurrencias tardías".

¿Qué sucede a continuación?

Fish Audio utilizará la financiación para desarrollar modelos más avanzados y atraer a clientes empresariales más grandes. Dos nuevos productos están en la hoja de ruta para 2025: un modelo de comprensión de audio, que interpretaría el significado y contenido de clips de audio, y un modelo de conversión de voz a voz que convierte una voz hablada en otra en tiempo real.

El mercado está saturado. ElevenLabs, WellSaid, Cartesia y Speechify compiten por los mismos desarrolladores y presupuestos comerciales. El argumento de Fish Audio es que puede igualar la calidad de vanguardia a un costo menor, en parte porque su equipo fundador reducido ha mantenido bajos los gastos de entrenamiento.

Para los usuarios ordinarios, la conclusión práctica es clara: busca tu nombre o voz en cualquier plataforma de audio con IA para la que no te hayas registrado explícitamente. Si encuentras algo, la mayoría de plataformas ahora tienen una ruta de retirada. La de Fish Audio ahora es más rápida que la mayoría.

Preguntas frecuentes

¿Puede una empresa usar legalmente tu voz para entrenar una IA sin pedirte permiso?

En la mayoría de jurisdicciones, no. La ley de derechos de autor y, en algunos estados de EE.UU., los estatutos de derechos de personalidad otorgan a los individuos control sobre el uso comercial de su voz. El panorama legal sigue evolucionando, pero cargar la voz de alguien más sin consentimiento ya conlleva un riesgo real para quien lo hace.

¿Qué es una ronda inicial y por qué suenan grandes $50 millones para una?

Una ronda inicial es la primera inversión formal externa que recibe una startup, generalmente utilizada para desarrollar producto e contratar personal. Cincuenta millones de dólares es inusualmente grande en esta etapa, reflejando cuánta competencia hay para respaldar empresas de infraestructura de IA antes de que alcancen rondas de financiación posteriores más caras.

© 2026 AI2Day