Fontes
Veja em ação
Explore os modelos e estilos por trás de histórias como esta — conta gratuita e galeria na hora.
Explorar o catálogo
Explore os modelos e estilos por trás de histórias como esta — conta gratuita e galeria na hora.
Explorar o catálogoA Fish Audio fechou uma rodada seed de US$ 52 milhões — uma das maiores captações seed em áudio com IA — sustentada por US$ 21 milhões em receita recorrente anual e mais de 8 milhões de usuários em seus modelos de voz de código aberto e hospedados.

Interface de clonagem de voz da Fish Audio, que permite aos criadores construir personagens de voz personalizados a partir de amostras de áudio curtas.
Imagem: TechCrunch / TechCrunch AI
A rodada se destaca não apenas pelo tamanho, mas pelo momento. A Fish Audio segundo o TechCrunch atingiu US$ 21 milhões de ARR antes de fechar o financiamento — uma posição rara para uma empresa em estágio seed e um sinal de que a demanda por infraestrutura de voz voltada a criadores é real, não especulativa.
O principal diferencial da Fish Audio é sua estratégia de modelo de dupla via. A empresa publica modelos de pesos abertos que desenvolvedores e criadores podem executar localmente ou ajustar, além de oferecer uma API hospedada para quem quer evitar a sobrecarga de infraestrutura. Essa divisão importa na prática: um criador que está construindo um personagem de IA com voz para um jogo ou história interativa pode pagar por chamada de API ou, se o volume for alto o suficiente, executar o modelo em seu próprio hardware e reduzir custos significativamente.
A clonagem de voz a partir de amostras de áudio curtas é o recurso que mais atrai a atenção dos criadores. Os modelos da Fish Audio conseguem gerar uma persona de voz consistente a partir de uma gravação breve — útil para quem está criando companheiros de IA, conteúdo de vídeo narrado ou experiências orientadas por personagens. Para criadores que já trabalham com personagens e companheiros gerados por IA, adicionar uma camada de voz persistente e clonável muda o que é possível sem exigir um pipeline completo de produção de áudio.
A Fish Audio é a concorrente de pesos abertos mais direta da ElevenLabs, que dominou o mercado de API de voz para criadores. A ElevenLabs é de código fechado e com preços por assinatura; a disponibilidade de modelos abertos da Fish Audio oferece aos criadores com orçamento limitado uma alternativa que não os prende a um único fornecedor. Para casos de uso de alto volume — audiolivros longos, diálogos em lote de personagens, narração automatizada de vídeos — a diferença de custo entre uma API hospedada e um modelo de pesos abertos auto-hospedado pode ser substancial.
A captação de US$ 52 milhões dá à Fish Audio o fôlego para fechar a lacuna de qualidade em relação às vozes mais refinadas da ElevenLabs, ao mesmo tempo em que expande o suporte a idiomas e as ferramentas de ajuste fino. A empresa não publicou um roadmap detalhado, mas o ângulo empresarial em seu pitch sugere investimento em inferência de streaming com menor latência e maior confiabilidade de API — ambos essenciais para aplicações de companheiros em tempo real.

A Fish Audio anunciou uma rodada seed de US$ 52 milhões, uma das maiores captações em estágio inicial em áudio com IA.
Imagem: TechCrunch / TechCrunch AI
Alcançar US$ 21 milhões de ARR antes de fechar uma rodada seed é incomum o suficiente para merecer destaque. A maioria das startups de infraestrutura de IA capta primeiro e depois busca receita. A inversão desse padrão pela Fish Audio sugere que sua estratégia de distribuição de código aberto — colocar os modelos nas mãos dos desenvolvedores antes de monetizar — está funcionando como um volante de crescimento. Criadores que começaram com os modelos gratuitos de pesos abertos estão convertendo para a API hospedada a uma taxa que gera receita recorrente significativa.
Para criadores que avaliam em qual stack de voz construir, esse número de receita é um indicador de qualidade do modelo e confiabilidade da API. Desenvolvedores pagam por coisas que funcionam. O número de 8 milhões de usuários, embora seja uma mistura de gratuitos e pagos, indica uma ampla adoção pela comunidade que tende a acelerar a melhoria de modelos de código aberto por meio de ajustes finos e conjuntos de dados contribuídos pela comunidade.
Criadores que exploram ferramentas de IA e opções de modelos agora têm uma opção de voz de pesos abertos bem financiada que vale a pena adicionar à sua lista de avaliação ao lado da ElevenLabs e da PlayHT. A questão prática é se a próxima geração de modelos da Fish Audio — financiada por esta rodada — fecha a lacuna de qualidade restante nas saídas de voz mais expressivas e emocionalmente matizadas. Esse é o benchmark que determinará se os US$ 52 milhões se traduzem em liderança de categoria.