Источники
Посмотри в деле
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталог
Полистай модели и стили, что стоят за такими историями — бесплатный аккаунт, галерея сразу.
Открыть каталогFish Audio закрыла посевной раунд на $52 миллиона — один из крупнейших посевных раундов в сфере ИИ-аудио — при поддержке $21 миллиона годовой повторяющейся выручки и более 8 миллионов пользователей открытых и размещённых голосовых моделей.

Интерфейс клонирования голоса Fish Audio, позволяющий креаторам создавать собственных голосовых персонажей из коротких аудиозаписей.
Изображение: TechCrunch / TechCrunch AI
Раунд примечателен не только своим размером, но и временем проведения. Fish Audio по данным TechCrunch достигла $21 млн ARR до закрытия финансирования — редкая позиция для компании на посевной стадии и сигнал того, что спрос на голосовую инфраструктуру уровня креаторов реален, а не спекулятивен.
Ключевое отличие Fish Audio — стратегия двойного трека моделей. Компания публикует открытые модели, которые разработчики и креаторы могут запускать локально или дообучать, а также предлагает размещённый API для тех, кто хочет избежать инфраструктурных издержек. Это разделение имеет практическое значение: креатор, создающий озвученного ИИ-персонажа для игры или интерактивной истории, может либо платить за каждый вызов API, либо — при достаточном объёме — запустить модель на собственном оборудовании и существенно сократить расходы.
Клонирование голоса из коротких аудиозаписей — функция, привлекающая наибольшее внимание креаторов. Модели Fish Audio способны генерировать устойчивую голосовую персону из краткой записи — это полезно для всех, кто создаёт ИИ-компаньонов, видеоконтент с закадровым голосом или опыт, основанный на персонажах. Для креаторов, уже работающих над ИИ-персонажами и компаньонами, добавление постоянного, клонируемого голосового слоя меняет возможности без необходимости выстраивать полный конвейер аудиопроизводства.
Fish Audio — наиболее прямой открытый конкурент ElevenLabs, доминирующего на рынке голосовых API для креаторов. ElevenLabs является закрытым и работает по подписке; наличие открытых моделей Fish Audio даёт экономным креаторам альтернативу, не привязывающую их к единственному поставщику. Для высоконагруженных сценариев — длинных аудиокниг, пакетных диалогов персонажей, автоматизированного озвучивания видео — разница в стоимости между размещённым API и самостоятельно развёрнутой открытой моделью может быть весьма существенной.
Привлечённые $52 млн дают Fish Audio ресурс для сокращения разрыва в качестве с наиболее отполированными голосами ElevenLabs, одновременно расширяя языковую поддержку и инструменты дообучения. Компания не публиковала детальной дорожной карты, однако корпоративный акцент в её презентации предполагает инвестиции в потоковый инференс с меньшей задержкой и повышенную надёжность API — оба аспекта критически важны для приложений с компаньонами в реальном времени.

Fish Audio объявила о посевном раунде на $52 млн — одном из крупнейших раундов ранней стадии в сфере ИИ-аудио.
Изображение: TechCrunch / TechCrunch AI
Достижение $21 млн ARR до закрытия посевного раунда — явление достаточно редкое, чтобы заслуживать отдельного внимания. Большинство стартапов в сфере ИИ-инфраструктуры сначала привлекают финансирование, а затем гонятся за выручкой. Инверсия этой модели у Fish Audio свидетельствует о том, что стратегия распространения через открытый исходный код — передача моделей в руки разработчиков до монетизации — работает как маховик роста. Креаторы, начавшие с бесплатных открытых моделей, конвертируются в пользователей размещённого API с темпом, обеспечивающим значимую повторяющуюся выручку.
Для креаторов, оценивающих, на каком голосовом стеке строить, этот показатель выручки служит косвенным индикатором качества моделей и надёжности API. Разработчики платят за то, что работает. Цифра в 8 миллионов пользователей, при всём смешении бесплатных и платных, указывает на широкое принятие сообществом, которое, как правило, ускоряет улучшение открытых моделей через дообучение сообществом и предоставленные датасеты.
Креаторы, изучающие ИИ-инструменты и варианты моделей, теперь имеют хорошо финансируемый открытый голосовой вариант, достойный включения в список оценки наряду с ElevenLabs и PlayHT. Практический вопрос состоит в том, сможет ли следующее поколение моделей Fish Audio — профинансированное этим раундом — закрыть оставшийся разрыв в качестве с наиболее выразительными, эмоционально нюансированными голосовыми выходами. Именно этот ориентир определит, превратятся ли $52 млн в лидерство в категории.