Sources
Voyez-le à l’œuvre
Parcourez les modèles et les styles derrière des histoires comme celle-ci — compte gratuit, galerie immédiate.
Explorer le catalogue
Parcourez les modèles et les styles derrière des histoires comme celle-ci — compte gratuit, galerie immédiate.
Explorer le catalogueFish Audio vient de boucler un tour de table seed de 52 millions de dollars — l'un des plus importants de l'histoire de l'audio IA — porté par 21 millions de dollars de revenus récurrents annuels et plus de 8 millions d'utilisateurs sur ses modèles vocaux open source et hébergés.

L'interface de clonage vocal de Fish Audio, qui permet aux créateurs de construire des personnages vocaux personnalisés à partir de courts échantillons audio.
Image : TechCrunch / TechCrunch AI
Ce tour de table est remarquable non seulement par son montant, mais aussi par son timing. Fish Audio selon TechCrunch avait atteint 21 M$ d'ARR avant de boucler le financement — une position rare pour une société en phase seed et un signal que la demande en infrastructure vocale de qualité créateur est bien réelle, et non spéculative.
Le principal atout différenciateur de Fish Audio réside dans sa stratégie de modèles à double voie. La société publie des modèles open-weight que les développeurs et créateurs peuvent exécuter localement ou affiner, tout en proposant une API hébergée pour ceux qui souhaitent s'affranchir des contraintes d'infrastructure. Cette distinction a des implications concrètes : un créateur qui développe un personnage IA vocal pour un jeu ou une histoire interactive peut soit payer à l'appel API, soit, si le volume est suffisamment élevé, faire tourner le modèle sur son propre matériel et réduire significativement les coûts.
Le clonage vocal à partir de courts échantillons audio est la fonctionnalité qui suscite le plus d'intérêt chez les créateurs. Les modèles de Fish Audio peuvent générer un persona vocal cohérent à partir d'un bref enregistrement — utile pour quiconque développe des compagnons IA, du contenu vidéo narré ou des expériences portées par des personnages. Pour les créateurs qui travaillent déjà sur des personnages et compagnons générés par IA, l'ajout d'une couche vocale persistante et clonable change le champ des possibles sans nécessiter une chaîne de production audio complète.
Fish Audio est le challenger open-weight le plus direct d'ElevenLabs, qui domine le marché des API vocales pour créateurs. ElevenLabs est en source fermée et facturé par abonnement ; la disponibilité des modèles ouverts de Fish Audio offre aux créateurs soucieux de leur budget une alternative qui ne les enferme pas dans un seul fournisseur. Pour les cas d'usage à fort volume — livres audio longue durée, dialogues de personnages en batch, narration vidéo automatisée — la différence de coût entre une API hébergée et un modèle open-weight auto-hébergé peut être considérable.
La levée de 52 M$ donne à Fish Audio la marge de manœuvre nécessaire pour combler l'écart de qualité avec les voix les plus abouties d'ElevenLabs, tout en élargissant le support linguistique et les outils d'affinage. La société n'a pas publié de feuille de route détaillée, mais l'angle entreprise de son pitch laisse entrevoir des investissements dans l'inférence en streaming à faible latence et une fiabilité API renforcée — deux éléments déterminants pour les applications de compagnons en temps réel.

Fish Audio a annoncé un tour de table seed de 52 M$, l'une des plus importantes levées early-stage dans l'audio IA.
Image : TechCrunch / TechCrunch AI
Atteindre 21 M$ d'ARR avant la clôture d'un tour seed est suffisamment inhabituel pour mériter d'être souligné. La plupart des startups d'infrastructure IA lèvent d'abord des fonds, puis courent après les revenus. L'inversion de ce schéma par Fish Audio suggère que sa stratégie de distribution open source — mettre les modèles entre les mains des développeurs avant de monétiser — fonctionne comme un volant de croissance. Les créateurs qui ont commencé avec les modèles open-weight gratuits se convertissent à l'API hébergée à un rythme qui génère des revenus récurrents significatifs.
Pour les créateurs qui évaluent sur quelle stack vocale construire, ce chiffre de revenus est un indicateur proxy de la qualité des modèles et de la fiabilité de l'API. Les développeurs paient pour ce qui fonctionne. Le chiffre de 8 millions d'utilisateurs, bien qu'il mélange gratuit et payant, témoigne d'une adoption communautaire large qui tend à accélérer l'amélioration des modèles open source grâce aux affinages communautaires et aux jeux de données contribués.
Les créateurs qui explorent les outils IA et les options de modèles disposent désormais d'une option vocale open-weight bien financée qui mérite d'être ajoutée à leur liste d'évaluation aux côtés d'ElevenLabs et de PlayHT. La question pratique est de savoir si la prochaine génération de modèles de Fish Audio — financée par ce tour de table — comble l'écart de qualité restant sur les sorties vocales les plus expressives et les plus nuancées émotionnellement. C'est ce critère qui déterminera si les 52 M$ se traduisent par un leadership de catégorie.