Fish Audio привлекает $50 млн для клонирования голосов, но вопросы о согласии остаются
Стартап из Пало-Альто имеет 8 млн пользователей и $21 млн годового дохода. Новое финансирование позволит расширить корпоративные контракты и развивать более продвинутые модели. Недавний скандал с несанкционированной загрузкой голосов полностью не разрешен.

Ключевые моменты
- Fish Audio завершила раунд финансирования в размере $50 млн во вторник, возглавляемый Coreline Ventures и Capital Today.
- Стартап отчитался об годовом повторяющемся доходе в размере $21 млн и более чем 8 млн пользователях по состоянию на эту неделю.
- Библиотека голосов Fish Audio была частично создана из пользовательских записей, некоторые из которых загружены без согласия оригинальных авторов.
- Компания автоматизировала процесс удаления голосов, обещая удаление в течение трех минут после проверенной жалобы.
- Fish Audio планирует выпустить модель понимания аудио и модель преобразования речи в речь до конца 2025 года.
Стартап из Пало-Альто, который позволяет разработчикам, дизайнерам игр и компаниям генерировать реалистичные синтетические голоса, только что получил крупный приток венчурного капитала на ранних этапах, подтверждая сильный интерес инвесторов к технологии синтеза голоса даже когда сектор борется со сложными вопросами о том, кому принадлежит голос.
Fish Audio объявила во вторник, что привлекла $50 млн в раунде начального финансирования, типичном для этапа, когда компания еще не доказала свою масштабируемость. Раунд возглавили Coreline Ventures и Capital Today, а также участвовали 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners и HF0.
Что делает Fish Audio?
Компания разрабатывает модели преобразования текста в речь — программное обеспечение, которое преобразует письменные слова в устную речь, с акцентом на выразительность и точный контроль. Ее библиотека предлагает более 15 000 элементов управления на естественном языке, что позволяет разработчику написать инструкцию вроде «звучи нервно, но уверенно» вместо использования технических ползунков.
Fish Audio выпустила пять моделей за последний год: четыре модели генерации речи и одну модель преобразования речи в текст, которая делает обратное — преобразует аудио в письменный текст. Три речевые модели являются открытым исходным кодом, что означает, что любой может свободно загрузить и использовать код. Ее последняя модель S2.1 Pro доступна только через платное API — интерфейс программирования, который позволяет другим приложениям интегрироваться с технологией Fish Audio.
Корни компании восходят к побочному проекту бывшего исследователя Nvidia Шиджи Ляо. Расстроенный робким звучанием синтетических голосов, он обучил модель на одном GPU — специализированном чипе, выполняющем вычислительные работы, необходимые для ИИ — и опубликовал код публично. С тех пор этот репозиторий собрал более 31 000 звезд на GitHub, грубый показатель интереса разработчиков.
Сегодня платежные клиенты включают HeyGen, который работает с ИИ-аватарами, и корпоративные платформы голосовых агентов. Fish Audio генерирует $21 млн годового повторяющегося дохода, что впервые сообщено TechCrunch.
Должны ли авторы беспокоиться об использовании их голосов без разрешения?
Возможно, да. Ранее в этом году некоторые исполнители утверждали, что их голоса появились на платформе Fish Audio без их согласия. Часть стратегии роста Fish Audio заключается в том, чтобы попросить пользователей отправлять голоса для обучения модели, компенсируя авторов, когда их записи используются. Система основана на доверии, и это доверие было нарушено.
С тех пор компания автоматизировала процесс удаления по DMCA. DMCA, Закон об авторском праве в цифровую эпоху, — это американский закон, который дает авторам официальный способ потребовать удаления своего защищенного авторским правом материала с онлайн-платформ. Генеральный директор Rissa Cao говорит, что проверенная жалоба теперь запускает удаление менее чем за три минуты.
Пробел в процессе по-прежнему остается реальным. Ничто не помешает кому-либо загрузить голос другого человека без его ведома. Голос остается в сети до тех пор, пока пострадавший создатель не обнаружит его и не подаст жалобу.
Оскуе Хонда, партнер основного инвестора Coreline Ventures, прямо признал проблему: «Согласие, прозрачность и атрибуция должны быть встроены в продукт, а не рассматриваться как вторичные вопросы».
Что дальше?
Fish Audio будет использовать финансирование для разработки более продвинутых моделей и привлечения крупных корпоративных клиентов. На дорожной карте на 2025 год два новых продукта: модель понимания аудио, которая интерпретирует смысл и содержание аудиозаписей, и модель преобразования речи в речь, которая в реальном времени преобразует один голос в другой.
Рынок переполнен. ElevenLabs, WellSaid, Cartesia и Speechify конкурируют за одних и тех же разработчиков и корпоративные бюджеты. Аргумент Fish Audio заключается в том, что она может соответствовать передовому качеству при более низких затратах, отчасти потому что небольшая команда основателей держит расходы на обучение на низком уровне.
Для обычных пользователей практический вывод понятен: поищите свое имя или голос на любой платформе ИИ-аудио, на которую вы явно не зарегистрировались. Если вы что-то найдете, большинство платформ теперь имеют маршрут удаления. У Fish Audio он теперь быстрее, чем у большинства.
Часто задаваемые вопросы
Может ли компания на законных основаниях использовать ваш голос для обучения ИИ без вашего разрешения?
В большинстве юрисдикций нет. Авторское право и в некоторых штатах США законодательство о правах личности дают людям контроль над коммерческим использованием их голоса. Правовая картина все еще развивается, но загрузка голоса другого человека без согласия уже создает реальный риск для загружающего.
Что такое раунд начального финансирования и почему $50 млн звучит как большая сумма?
Раунд начального финансирования — это первые формальные внешние инвестиции, которые привлекает стартап, обычно используемые для разработки продукта и найма сотрудников. Пятьдесят миллионов долларов — необычно большая сумма на этом этапе, что отражает высокую конкуренцию за инвестирование в компании инфраструктуры ИИ до более поздних и дорогостоящих раундов финансирования.



