Fish Audio raccoglie 50 milioni di dollari per clonare la voce di chiunque, ma rimangono dubbi sul consenso
La startup di Palo Alto ha 8 milioni di utenti e 21 milioni di dollari di fatturato annuale. I nuovi finanziamenti consentiranno di espandersi nei contratti enterprise e nei modelli più avanzati. Una recente controversia sui caricamenti non autorizzati di voci rimane solo parzialmente risolta.

Punti chiave
- Fish Audio ha chiuso un round di seed da 50 milioni di dollari martedì, guidato da Coreline Ventures e Capital Today.
- La startup ha segnalato 21 milioni di dollari di ricavi annuali ricorrenti e più di 8 milioni di utenti a partire da questa settimana.
- La libreria di voci di Fish Audio è stata costruita in parte da registrazioni caricate dagli utenti, alcune delle quali sono state caricate senza il consenso dei creatori originali.
- L'azienda ha automatizzato il processo di rimozione delle voci, promettendo l'eliminazione in meno di tre minuti dopo una rivendicazione verificata.
- Fish Audio prevede di rilasciare un modello di audio-understanding e un modello speech-to-speech entro la fine del 2025.
Una startup di Palo Alto che permette a sviluppatori, game designer e aziende di generare voci sintetiche realistiche ha appena ottenuto un'importante iniezione di finanziamenti in fase iniziale, confermando il forte appetito degli investitori per la tecnologia vocale AI, anche mentre il settore affronta complesse questioni su chi possiede effettivamente una voce.
Fish Audio ha annunciato martedì di aver raccolto 50 milioni di dollari in un round di seed, il tipo di finanziamento iniziale che generalmente precede quando un'azienda ha provato di poter scalare. Coreline Ventures e Capital Today hanno guidato il round, con la partecipazione anche di 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners e HF0.
Che cosa fa effettivamente Fish Audio?
L'azienda crea modelli di sintesi vocale, software che converte testo scritto in audio parlato, con un focus su espressività e controllo granulare. La sua libreria offre più di 15.000 comandi in linguaggio naturale, il che significa che uno sviluppatore può scrivere un'istruzione come "suona nervoso ma rassicurante" anziché regolare cursori tecnici.
Fish Audio ha lanciato cinque modelli nell'ultimo anno: quattro modelli di generazione vocale e uno modello speech-to-text, che fa il contrario convertendo l'audio in testo scritto. Tre dei modelli vocali sono open-source, il che significa che chiunque può scaricare e utilizzare il codice liberamente. Il suo ultimo modello, S2.1 Pro, è disponibile solo tramite un'API a pagamento, un'interfaccia di programmazione che consente ad altre app di connettersi alla tecnologia di Fish Audio.
L'azienda affonda le radici in un progetto secondario del ricercatore ex Nvidia Shijia Liao. Frustrato da quanto suonassero robotiche le voci sintetiche, ha addestrato un modello su una singola GPU, il chip specializzato che esegue i calcoli numerici pesanti che l'AI richiede, e ha pubblicato il codice pubblicamente. Quel repository ha successivamente raccolto più di 31.000 stelle su GitHub, una misura approssimativa dell'interesse degli sviluppatori.
Oggi, i clienti paganti includono HeyGen, che alimenta avatar AI, e piattaforme di agenti vocali enterprise. Fish Audio genera 21 milioni di dollari in ricavi annuali ricorrenti, primo riportato da TechCrunch.
Dovrebbero i creatori preoccuparsi che le loro voci vengano utilizzate senza permesso?
Probabilmente sì. All'inizio di quest'anno, alcuni artisti hanno affermato che le loro voci sono apparse sulla piattaforma Fish Audio senza il loro consenso. Parte della strategia di crescita di Fish Audio prevede di chiedere agli utenti di inviare voci per l'addestramento dei modelli, compensando i contributori quando le loro registrazioni vengono utilizzate. Il sistema si basa sulla fiducia, e quella fiducia si è incrinata.
L'azienda ha successivamente automatizzato il processo di rimozione DMCA. DMCA, il Digital Millennium Copyright Act, è una legge statunitense che offre ai creatori un percorso formale per richiedere la rimozione del loro materiale protetto da copyright dalle piattaforme online. La CEO Rissa Cao afferma che un reclamo verificato attiva ora la rimozione in meno di tre minuti.
Il divario nel processo rimane comunque reale. Nulla impedisce a qualcuno di caricare la voce di un'altra persona senza la loro conoscenza. La voce rimane in diretta fino a quando il creatore colpito non la scopre e presenta un reclamo.
Oskue Honda, partner dell'investitore principale Coreline Ventures, ha riconosciuto il problema direttamente: "Il consenso, la trasparenza e l'attribuzione devono essere incorporati nel prodotto piuttosto che trattati come ripensamenti."
Che cosa succede dopo?
Fish Audio utilizzerà i finanziamenti per sviluppare modelli più avanzati e corteggiare clienti enterprise più grandi. Due nuovi prodotti sono sulla roadmap per il 2025: un modello di audio-understanding, che interpreterebbe il significato e il contenuto dei clip audio, e un modello speech-to-speech che converte una voce parlata in un'altra in tempo reale.
Il mercato è affollato. ElevenLabs, WellSaid, Cartesia e Speechify competono tutti per gli stessi sviluppatori e budget aziendali. L'argomentazione di Fish Audio è che può corrispondere alla qualità all'avanguardia a un costo inferiore, in parte perché il suo team fondatore snello ha mantenuto le spese di addestramento basse.
Per gli utenti ordinari, il consiglio pratico è semplice: cerca il tuo nome o la tua voce su qualsiasi piattaforma audio AI per la quale non ti sei esplicitamente iscritto. Se trovi qualcosa, la maggior parte delle piattaforme ora ha un percorso di rimozione. Quello di Fish Audio è ora più veloce della maggior parte.
Domande frequenti
Un'azienda può legalmente utilizzare la tua voce per addestrare un'AI senza chiederti il permesso?
Nella maggior parte delle giurisdizioni, no. La legge sul diritto d'autore e, in alcuni stati statunitensi, gli statuti di diritto di pubblicità danno ai singoli il controllo sull'uso commerciale della loro voce. Il quadro legale è ancora in evoluzione, ma il caricamento della voce di qualcun altro senza consenso comporta già un rischio reale per chi carica.
Che cos'è un round di seed e perché 50 milioni di dollari suonano così numerosi per uno?
Un round di seed è il primo investimento esterno formale che una startup effettua, di solito utilizzato per costruire il prodotto e assumere personale. Cinquanta milioni di dollari è insolitamente grande in questa fase, riflettendo quanta competizione c'è per sostenere le aziende di infrastrutture AI prima che raggiungano i successivi, più costosi round di finanziamento.



