Джерела
Подивись у дії
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталог
Переглянь моделі та стилі, що стоять за такими історіями — безкоштовний акаунт, галерея одразу.
Відкрити каталогFish Audio закрила посівний раунд на $52 мільйони — один з найбільших посівних раундів у сфері ШІ-аудіо — підкріплений $21 мільйоном річного повторюваного доходу та понад 8 мільйонами користувачів її голосових моделей з відкритим кодом та хостингових моделей.

Інтерфейс клонування голосу Fish Audio, який дозволяє креаторам створювати власних голосових персонажів з коротких аудіозразків.
Зображення: TechCrunch / TechCrunch AI
Раунд примітний не лише своїм розміром, але й часом проведення. Fish Audio згідно з TechCrunch досягла $21 млн ARR до закриття фінансування — рідкісна позиція для компанії посівної стадії та сигнал того, що попит на голосову інфраструктуру креаторського рівня є реальним, а не спекулятивним.
Основна відмінність Fish Audio — це стратегія подвійної моделі. Компанія публікує моделі з відкритими вагами, які розробники та креатори можуть запускати локально або налаштовувати, водночас пропонуючи хостинговий API для тих, хто хоче пропустити накладні витрати на інфраструктуру. Це розділення має практичне значення: креатор, який створює озвучений ШІ-персонаж для гри або інтерактивної історії, може або платити за кожен виклик API, або, якщо обсяг достатньо великий, запускати модель на власному обладнанні та значно знизити витрати.
Клонування голосу з коротких аудіозразків — це функція, яка привертає найбільшу увагу креаторів. Моделі Fish Audio можуть генерувати послідовну голосову персону з короткого запису — корисно для будь-кого, хто створює ШІ-компаньйонів, озвучений відеоконтент або досвіди, орієнтовані на персонажів. Для креаторів, які вже працюють над ШІ-генерованими персонажами та компаньйонами, додавання стійкого, клонованого голосового шару змінює можливості без потреби в повному конвеєрі аудіопродукції.
Fish Audio є найбільш прямим викликом з відкритими вагами для ElevenLabs, яка домінує на ринку креаторських голосових API. ElevenLabs має закритий код та підписну ціну; доступність відкритої моделі Fish Audio дає креаторам, обмеженим бюджетом, альтернативу, яка не прив'язує їх до одного постачальника. Для високооб'ємних випадків використання — довгих аудіокниг, пакетних діалогів персонажів, автоматизованого озвучування відео — різниця у вартості між хостинговим API та самостійно розміщеною моделлю з відкритими вагами може бути суттєвою.
Залучення $52 млн дає Fish Audio ресурс для скорочення розриву в якості з найбільш відшліфованими голосами ElevenLabs, розширюючи мовну підтримку та інструменти налаштування. Компанія не опублікувала детальну дорожню карту, але корпоративний кут у її презентації свідчить про інвестиції в потокову інференцію з меншою затримкою та вищу надійність API — обидва аспекти важливі для додатків компаньйонів реального часу.

Fish Audio оголосила посівний раунд на $52 млн, один з найбільших ранніх раундів у сфері ШІ-аудіо.
Зображення: TechCrunch / TechCrunch AI
Досягнення $21 млн ARR до закриття посівного раунду достатньо незвично, щоб варто це відзначити. Більшість стартапів ШІ-інфраструктури спочатку залучають кошти, а потім переслідують дохід. Інверсія Fish Audio цього шаблону свідчить, що її стратегія розповсюдження з відкритим кодом — отримання моделей у руки розробників перед монетизацією — працює як маховик зростання. Креатори, які почали з безкоштовних моделей з відкритими вагами, конвертуються в хостинговий API зі швидкістю, яка виробляє значущий повторюваний дохід.
Для креаторів, які оцінюють, на якому голосовому стеку будувати, ця цифра доходу є показником якості моделі та надійності API. Розробники платять за те, що працює. Число в 8 мільйонів користувачів, хоча й є сумішшю безкоштовних та платних, вказує на широке прийняття спільнотою, що зазвичай прискорює покращення моделей з відкритим кодом через спільнотні налаштування та внесені набори даних.
Креатори, які досліджують ШІ-інструменти та варіанти моделей, тепер мають добре фінансований варіант голосу з відкритими вагами, який варто додати до свого списку оцінки поряд з ElevenLabs та PlayHT. Практичне питання полягає в тому, чи закриє наступне покоління моделей Fish Audio — фінансоване цим раундом — решту розриву в якості на найбільш виразних, емоційно нюансованих голосових виходах. Це еталон, який визначить, чи перетвориться $52 млн у лідерство категорії.