Fish Audio raccoglie 50 milioni di dollari per consentire a chiunque di clonare una voce, ma restano dubbi sul consenso

La startup di Palo Alto ha 8 milioni di utenti e 21 milioni di dollari di ricavi annuali. I nuovi finanziamenti consentiranno di espandersi nei contratti enterprise e nei modelli più avanzati. Una recente controversia sui caricamenti di voci non autorizzati non è ancora pienamente risolta.

AI2Day NewsdeskUpdated Editor: Lee Brown4 min read
A sleek modern corporate office interior at dusk, glass walls reflecting city lights, an empty executive chair at a large curved desk with a glowing monitor sho
Share

Punti chiave

  • Fish Audio ha chiuso un round di seed da 50 milioni di dollari martedì, guidato da Coreline Ventures e Capital Today.
  • La startup ha segnalato 21 milioni di dollari di ricavi ricorrenti annuali e più di 8 milioni di utenti a questa settimana.
  • La libreria vocale di Fish Audio è stata costruita in parte da registrazioni inviate dagli utenti, alcune delle quali sono state caricate senza il consenso dei creatori originali.
  • L'azienda ha automatizzato il processo di rimozione delle voci, promettendo la cancellazione in meno di tre minuti dopo una rivendicazione verificata.
  • Fish Audio prevede di rilasciare un modello di comprensione audio e un modello speech-to-speech entro la fine del 2025.

Una startup di Palo Alto che consente a sviluppatori e designer di videogiochi di generare voci sintetiche realistiche ha assicurato un'iniezione significativa di finanziamenti nella fase iniziale, confermando un forte appetito degli investitori per la tecnologia vocale AI, anche mentre il settore affronta questioni spinose su a chi appartiene la voce.

Fish Audio ha annunciato martedì di aver raccolto 50 milioni di dollari in un round di seed, il tipo di finanziamento iniziale che in genere arriva prima che un'azienda abbia provato se stessa su larga scala. Coreline Ventures e Capital Today hanno guidato il round, con 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners e HF0 che hanno partecipato.

Che cosa fa esattamente Fish Audio?

L'azienda sviluppa modelli di sintesi vocale da testo, software che converte parole scritte in audio parlato, con un focus sull'espressività e sul controllo dettagliato. La sua libreria offre più di 15.000 controlli in linguaggio naturale, così uno sviluppatore può scrivere un'istruzione come "suona nervoso ma rassicurante" piuttosto che regolare cursori tecnici.

Fish Audio ha lanciato cinque modelli nell'ultimo anno: quattro modelli di generazione vocale e un modello speech-to-text, che fa il contrario e converte l'audio in testo scritto. Tre dei modelli vocali sono open-source, il che significa che chiunque può scaricare e utilizzare il codice liberamente. Il suo ultimo modello, S2.1 Pro, è disponibile solo tramite un'API a pagamento, un'interfaccia di programmazione che consente ad altre app di collegarsi alla tecnologia di Fish Audio.

L'azienda affonda le radici in un progetto collaterale del ex ricercatore Nvidia Shijia Liao. Frustrato da come suonassero robotiche le voci sintetiche, ha addestrato un modello su una singola GPU, il chip specializzato che esegue il pesante calcolo numerico che l'AI richiede, e ha pubblicato il codice pubblicamente. Quel repository ha da allora raccolto più di 31.000 stelle su GitHub, una misura approssimativa dell'interesse degli sviluppatori.

Oggi, i clienti paganti includono HeyGen, che alimenta avatar AI, e piattaforme di agenti vocali enterprise. Fish Audio genera 21 milioni di dollari in ricavi ricorrenti annuali, riferito per la prima volta da TechCrunch.

I creatori dovrebbero preoccuparsi che le loro voci vengano utilizzate senza permesso?

Possibilmente, sì. Entro quest'anno, alcuni artisti hanno affermato che le loro voci sono apparse sulla piattaforma di Fish Audio senza il loro consenso. La strategia di crescita di Fish Audio coinvolge la richiesta agli utenti di inviare voci per l'addestramento dei modelli e il compenso dei contributori quando le loro registrazioni vengono utilizzate. Quella fiducia si è incrinata.

Da allora l'azienda ha automatizzato il processo di rimozione DMCA. DMCA, il Digital Millennium Copyright Act, è una legge statunitense che fornisce ai creatori un percorso formale per richiedere la rimozione del loro materiale protetto da diritti d'autore dalle piattaforme online. La CEO Rissa Cao ha detto a TechCrunch che un reclamo verificato ora attiva la rimozione in meno di tre minuti.

Il vuoto nel processo rimane reale, però. Nulla impedisce a qualcuno di caricare la voce di un'altra persona senza la sua conoscenza, e la voce rimane attiva fino a quando il creatore interessato non la scopre e presenta un reclamo. È lo stesso problema strutturale che abbiamo segnalato nella violazione di Suno all'inizio di quest'anno: una rimozione più rapida aiuta, ma non affronta come il materiale sia finito lì in primo luogo.

Oskue Honda, partner dell'investitore principale Coreline Ventures, ha riconosciuto direttamente il problema: "Il consenso, la trasparenza e l'attribuzione devono essere incorporati nel prodotto piuttosto che trattati come ripensamenti."

Che cosa succede dopo?

Fish Audio utilizzerà i finanziamenti per sviluppare modelli più avanzati e corteggiare clienti enterprise più grandi. Due nuovi prodotti sono sulla roadmap per il 2025: un modello di comprensione audio, che interpreterebbe il significato e il contenuto dei clip audio, e un modello speech-to-speech che converte una voce parlata in un'altra in tempo reale.

Il mercato è affollato. ElevenLabs, WellSaid, Cartesia e Speechify competono tutti per gli stessi sviluppatori e budget aziendali. L'argomento di Fish Audio è che può corrispondere alla qualità leader a un costo inferiore, in parte perché il suo team fondatore snello ha mantenuto le spese di addestramento basse.

Per gli utenti ordinari, il risultato pratico è diretto: cerca il tuo nome o la tua voce su qualsiasi piattaforma audio AI a cui non ti sei esplicitamente iscritto. Se trovi qualcosa, la maggior parte delle piattaforme ora ha una route di rimozione, e quella di Fish Audio è ora più veloce della maggior parte.

Domande comuni

Un'azienda può legalmente utilizzare la tua voce per addestrare un'AI senza chiederti il permesso?

Nella maggior parte delle giurisdizioni, no. La legge sui diritti d'autore e, in alcuni stati USA, gli statuti sul diritto di pubblicità danno ai singoli il controllo sull'uso commerciale della loro voce. Il quadro legale è ancora in evoluzione, ma il caricamento della voce di qualcun altro senza consenso comporta già rischi reali per chi carica.

Che cos'è un seed round e perché 50 milioni di dollari sembrano tanti per uno?

Un seed round è il primo investimento esterno formale che una startup riceve, di solito utilizzato per costruire un prodotto e assumere personale. Cinquanta milioni di dollari sono inusualmente grandi in questa fase, riflettendo la quantità di competizione per supportare le aziende di infrastrutture AI prima di raggiungere round di finanziamento successivi più costosi.

© 2026 AI2Day