Fuentes
Míralo en acción
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogo
Explora los modelos y estilos detrás de historias como esta: cuenta gratis y galería al instante.
Explorar el catálogoFish Audio ha cerrado una ronda semilla de 52 millones de dólares — una de las mayores rondas semilla en audio con IA — respaldada por 21 millones de dólares en ingresos recurrentes anuales y más de 8 millones de usuarios en sus modelos de voz de código abierto y alojados.

La interfaz de clonación de voz de Fish Audio, que permite a los creadores construir personajes de voz personalizados a partir de muestras de audio breves.
Imagen: TechCrunch / TechCrunch AI
La ronda destaca no solo por su tamaño, sino también por su momento. Fish Audio según TechCrunch alcanzó los 21 millones de ARR antes de cerrar la financiación — una posición poco habitual para una empresa en etapa semilla y una señal de que la demanda de infraestructura de voz de nivel creador es real, no especulativa.
El diferenciador principal de Fish Audio es su estrategia de modelo de doble vía. La empresa publica modelos de pesos abiertos que desarrolladores y creadores pueden ejecutar localmente o ajustar, al tiempo que ofrece una API alojada para quienes desean evitar la carga de infraestructura. Esa división importa en la práctica: un creador que construye un personaje de IA con voz para un juego o una historia interactiva puede pagar por llamada a la API o, si el volumen es suficientemente alto, ejecutar el modelo en su propio hardware y reducir costes de forma significativa.
La clonación de voz a partir de muestras de audio breves es la función que más atención atrae entre los creadores. Los modelos de Fish Audio pueden generar una persona de voz consistente a partir de una grabación corta, algo útil para cualquiera que construya compañeros de IA, contenido de vídeo narrado o experiencias basadas en personajes. Para los creadores que ya trabajan en personajes y compañeros generados con IA, añadir una capa de voz persistente y clonable cambia lo que es posible sin necesidad de un pipeline completo de producción de audio.
Fish Audio es el competidor de pesos abiertos más directo de ElevenLabs, que ha dominado el mercado de APIs de voz para creadores. ElevenLabs es de código cerrado y con precios por suscripción; la disponibilidad del modelo abierto de Fish Audio ofrece a los creadores con presupuesto ajustado una alternativa que no los ata a un único proveedor. Para casos de uso de alto volumen — audiolibros de larga duración, diálogos de personajes en lote, narración automatizada de vídeo — la diferencia de coste entre una API alojada y un modelo de pesos abiertos autoalojado puede ser sustancial.
La ronda de 52 millones de dólares le da a Fish Audio el margen para cerrar la brecha de calidad con las voces más pulidas de ElevenLabs, al tiempo que amplía el soporte de idiomas y las herramientas de ajuste fino. La empresa no ha publicado una hoja de ruta detallada, pero el enfoque empresarial en su propuesta sugiere inversión en inferencia de streaming de menor latencia y mayor fiabilidad de la API, ambas cruciales para aplicaciones de compañeros en tiempo real.

Fish Audio anunció una ronda semilla de 52 millones de dólares, una de las mayores rondas en etapa temprana en audio con IA.
Imagen: TechCrunch / TechCrunch AI
Alcanzar 21 millones de ARR antes de cerrar una ronda semilla es lo suficientemente inusual como para merecer atención. La mayoría de las startups de infraestructura de IA recaudan primero y luego persiguen los ingresos. La inversión de ese patrón por parte de Fish Audio sugiere que su estrategia de distribución de código abierto — poner los modelos en manos de los desarrolladores antes de monetizar — está funcionando como un volante de crecimiento. Los creadores que comenzaron con los modelos gratuitos de pesos abiertos están convirtiéndose a la API alojada a una tasa que genera ingresos recurrentes significativos.
Para los creadores que evalúan sobre qué stack de voz construir, esa cifra de ingresos es un indicador de la calidad del modelo y la fiabilidad de la API. Los desarrolladores pagan por lo que funciona. El número de 8 millones de usuarios, aunque mezcla usuarios gratuitos y de pago, indica una adopción comunitaria amplia que tiende a acelerar la mejora de los modelos de código abierto a través de ajustes finos comunitarios y conjuntos de datos aportados.
Los creadores que exploran herramientas de IA y opciones de modelos ahora tienen una opción de voz de pesos abiertos bien financiada que vale la pena añadir a su lista de evaluación junto a ElevenLabs y PlayHT. La pregunta práctica es si la próxima generación de modelos de Fish Audio — financiada por esta ronda — cierra la brecha de calidad restante en las salidas de voz más expresivas y con mayor matiz emocional. Ese es el referente que determinará si los 52 millones de dólares se traducen en liderazgo de categoría.