Fish Audio залучила $50 млн для клонування голосів, але питання дозволу залишаються

Стартап з Пало-Альто має 8 млн користувачів і $21 млн щорічного доходу. Його новий фінансування спрямовано на корпоративні контракти та більш продвинуті моделі. Недавна контроверсія щодо несанкціонованого завантаження голосів не повністю вирішена.

AI2Day Newsdesk4 min read
A sleek modern corporate office interior at dusk, glass walls reflecting city lights, an empty executive chair at a large curved desk with a glowing monitor sho
Share

Ключові моменти

  • Fish Audio завершила раунд seed фінансування у розмірі $50 млн у вівторок, очолюваний Coreline Ventures та Capital Today.
  • Стартап повідомив про $21 млн щорічного повторюваного доходу та більше 8 млн користувачів станом на цей тиждень.
  • Бібліотека голосів Fish Audio була побудована частково з користувацьких записів, деякі з яких були завантажені без дозволу оригінальних творців.
  • Компанія автоматизувала процес видалення голосів, обіцяючи видалення менше ніж за три хвилини після перевіреної скарги.
  • Fish Audio планує випустити модель розуміння звуку та модель мовлення в мовлення до кінця 2025 року.

Стартап з Пало-Альто, який дозволяє розробникам, дизайнерам ігор та компаніям генерувати реалістичні синтетичні голоси, щойно отримав значну інвестицію на ранньому етапі, підтверджуючи сильний інтерес інвесторів до технології штучного інтелекту для обробки голосу, навіть коли сектор бореться з складними питаннями про те, кому належить голос.

Fish Audio оголосила у вівторок, що залучила $50 млн у раунді seed, тип раннього фінансування, який зазвичай приходить до того, як компанія довести себе у масштабі. Coreline Ventures та Capital Today очолили раунд, до якого також приєдналися 359 Capital, Parable, Play Time, Alphalist Partners, Bayhouse Ventures, Carya Venture Partners та HF0.

Що насправді робить Fish Audio?

Компанія розробляє моделі синтезу тексту в мовлення, програмне забезпечення, яке перетворює написаний текст на звуковий файл, з акцентом на виразність та детальний контроль. Його бібліотека пропонує понад 15 000 елементів керування природною мовою, що означає, що розробник може написати інструкцію типу «звучати нервово, але заспокійливо» замість коригування технічних параметрів.

Fish Audio запустила п'ять моделей за минулий рік: чотири моделі генерації мовлення та одна модель синтезу мовлення на текст, яка робить зворотне й перетворює звук на письмовий текст. Три з моделей мовлення мають відкритий код, що означає, що будь-хто може безплатно завантажити та використовувати код. Її найновіша модель S2.1 Pro доступна лише через платний API, програмний інтерфейс, який дозволяє іншим додаткам підключатися до технології Fish Audio.

Компанія вирощувалася з побічного проєкту колишнього дослідника Nvidia Shijia Liao. Розчарований тим, як звучали робототехнічні синтетичні голоси, він навчив модель на одному GPU, спеціалізованому чипу, який виконує важкі обчислення, необхідні для штучного інтелекту, та опублікував код публічно. Цей репозиторій отримав понад 31 000 зірок на GitHub, грубу міру інтересу розробників.

Сьогодні платні клієнти включають HeyGen, який забезпечує аватари на основі штучного інтелекту, та корпоративні платформи голосових агентів. Fish Audio генерує $21 млн щорічного повторюваного доходу, про що спочатку повідомила TechCrunch.

Чи мають хвилюватися творці щодо використання їхніх голосів без дозволу?

Можливо, так. На початку цього року деякі артисти стверджували, що їхні голоси з'явилися на платформі Fish Audio без їхньої згоди. Частина стратегії зростання Fish Audio передбачає запит у користувачів щодо надання голосів для навчання моделі, з компенсацією учасникам, коли їхні записи використовуються. Система покладається на довіру, і ця довіра розтріскалася.

Компанія з тих пір автоматизувала процес видалення DMCA. DMCA, Закон про авторське право у цифровому столітті, — це закон США, який надає творцям формальний шлях для вимоги видалення їхніх матеріалів, охоронюваних авторським правом, з онлайн-платформ. Генеральна директорка Rissa Cao говорить, що перевірена скарга тепер спричиняє видалення менше ніж за три хвилини.

Прогалина в процесі все ще залишається реальною. Ніщо не заважає комусь завантажити голос іншої особи без її відома. Голос залишається в мережі до того, як постраждалий творець виявить його та подасть скаргу.

Oskue Honda, партнер провідного інвестора Coreline Ventures, прямо визнав проблему: «Дозвіл, прозорість та атрибуція мають бути вбудовані в продукт, а не розглядатися як додаткові моменти.»

Що буде далі?

Fish Audio використовуватиме фінансування для розробки більш продвинутих моделей та залучення більших корпоративних клієнтів. Два нових продукти заплановані на 2025 рік: модель розуміння звуку, яка б інтерпретувала значення та вміст звукових кліпів, та модель синтезу мовлення в мовлення, яка в реальному часі перетворює один голос на інший.

Ринок переповнений. ElevenLabs, WellSaid, Cartesia та Speechify конкурують за одних і тих же розробників та корпоративні бюджети. Аргумент Fish Audio полягає в тому, що вона може відповідати якості найсучасніших методів за нижчою ціною, частково тому, що її невелика команда засновників тримала витрати на навчання низькими.

Для звичайних користувачів практичний висновок простий: пошукайте своє ім'я або голос на будь-якій платформі штучного інтелекту для обробки звуку, на яку ви явно не зареєструвалися. Якщо ви щось знайдете, більшість платформ тепер мають маршрут видалення. Fish Audio тепер має більш швидкий маршрут, ніж більшість.

Часті питання

Чи може компанія законно використовувати ваш голос для навчання штучного інтелекту без запиту?

У більшості юрисдикцій — ні. Закон про авторське право та в деяких штатах США статути про право на публічність дають людям контроль над комерційним використанням їхнього голосу. Правова картина все ще розвивається, але завантаження чужого голосу без дозволу вже становить реальний ризик для того, хто його завантажує.

Що таке раунд seed, і чому $50 млн звучить великою сумою для нього?

Раунд seed — це перша формальна зовнішня інвестиція, яку отримує стартап, зазвичай використовується для розробки продукту та найму персоналу. П'ятдесят млн доларів — це незвично великий розмір на цьому етапі, що відбиває, як багато конкуренції існує для підтримки компаній інфраструктури штучного інтелекту до того, як вони досягнуть пізніших, дорожчих раундів фінансування.

© 2026 AI2Day