Źródła
Zobacz w akcji
Przejrzyj modele i style stojące za takimi historiami — darmowe konto i galeria od razu.
Przeglądaj katalog
Przejrzyj modele i style stojące za takimi historiami — darmowe konto i galeria od razu.
Przeglądaj katalogFish Audio zamknęło rundę seed o wartości 52 milionów USD — jedną z największych rund seed w obszarze AI audio — przy wsparciu 21 milionów USD rocznych powtarzających się przychodów i ponad 8 milionach użytkowników korzystających z otwartoźródłowych i hostowanych modeli głosowych.

Interfejs klonowania głosu Fish Audio, który pozwala twórcom budować niestandardowe postacie głosowe z krótkich próbek audio.
Obraz: TechCrunch / TechCrunch AI
Runda jest godna uwagi nie tylko ze względu na swój rozmiar, ale i moment. Fish Audio według TechCrunch osiągnęło 21 mln USD ARR przed zamknięciem finansowania — rzadka pozycja dla firmy na etapie seed i sygnał, że zapotrzebowanie na infrastrukturę głosową klasy twórców jest realne, a nie spekulatywne.
Głównym wyróżnikiem Fish Audio jest strategia modelu dwutorowego. Firma publikuje modele open-weight, które deweloperzy i twórcy mogą uruchamiać lokalnie lub dostrajać, oferując jednocześnie hostowane API dla tych, którzy chcą pominąć narzut infrastrukturalny. Ten podział ma praktyczne znaczenie: twórca budujący postać AI z głosem do gry lub interaktywnej historii może albo płacić za każde wywołanie API, albo — jeśli wolumen jest wystarczająco wysoki — uruchomić model na własnym sprzęcie i znacznie obniżyć koszty.
Klonowanie głosu z krótkich próbek audio to funkcja przyciągająca największą uwagę twórców. Modele Fish Audio potrafią wygenerować spójną personę głosową z krótkiego nagrania — przydatne dla każdego, kto buduje towarzyszy AI, narrowane treści wideo lub doświadczenia oparte na postaciach. Dla twórców już pracujących nad postaciami i towarzyszami generowanymi przez AI, dodanie trwałej, klonowanej warstwy głosowej zmienia to, co jest możliwe, bez konieczności posiadania pełnego pipeline'u produkcji audio.
Fish Audio jest najbardziej bezpośrednim rywalem open-weight dla ElevenLabs, który zdominował rynek API głosowych dla twórców. ElevenLabs jest zamkniętym źródłem z cenami subskrypcyjnymi; dostępność otwartego modelu Fish Audio daje twórcom dbającym o budżet alternatywę, która nie uzależnia ich od jednego dostawcy. W przypadkach użycia o dużym wolumenie — długich audiobooków, wsadowych dialogów postaci, zautomatyzowanej narracji wideo — różnica kosztów między hostowanym API a samodzielnie hostowanym modelem open-weight może być znaczna.
Runda 52 mln USD daje Fish Audio zasoby do zamknięcia luki jakościowej względem najbardziej dopracowanych głosów ElevenLabs, przy jednoczesnym rozszerzaniu obsługi języków i narzędzi do dostrajania. Firma nie opublikowała szczegółowej mapy drogowej, ale kąt enterprise w jej prezentacji sugeruje inwestycje w wnioskowanie strumieniowe o niższym opóźnieniu i większą niezawodność API — oba te aspekty mają znaczenie dla aplikacji towarzyszy działających w czasie rzeczywistym.

Fish Audio ogłosiło rundę seed o wartości 52 mln USD, jedną z największych rund na wczesnym etapie w obszarze AI audio.
Obraz: TechCrunch / TechCrunch AI
Osiągnięcie 21 mln USD ARR przed zamknięciem rundy seed jest na tyle niezwykłe, że warto to odnotować. Większość startupów infrastruktury AI najpierw pozyskuje fundusze, a potem goni za przychodami. Odwrócenie tego wzorca przez Fish Audio sugeruje, że jego strategia dystrybucji otwartoźródłowej — udostępnianie modeli deweloperom przed monetyzacją — działa jako koło zamachowe wzrostu. Twórcy, którzy zaczęli od bezpłatnych modeli open-weight, konwertują do hostowanego API w tempie generującym znaczące powtarzające się przychody.
Dla twórców oceniających, na którym stosie głosowym budować, ta liczba przychodów jest wskaźnikiem jakości modelu i niezawodności API. Deweloperzy płacą za rzeczy, które działają. Liczba 8 milionów użytkowników, będąca mieszanką bezpłatnych i płatnych, wskazuje na szeroką adopcję społecznościową, która zwykle przyspiesza ulepszanie modeli otwartoźródłowych poprzez dostrajanie przez społeczność i wnoszone zestawy danych.
Twórcy eksplorujący narzędzia AI i opcje modeli mają teraz dobrze dofinansowaną opcję głosową open-weight wartą dodania do listy ocen obok ElevenLabs i PlayHT. Praktyczne pytanie brzmi, czy następna generacja modeli Fish Audio — sfinansowana tą rundą — zamknie pozostałą lukę jakościową w zakresie najbardziej ekspresyjnych, emocjonalnie niuansowanych wyników głosowych. To jest punkt odniesienia, który zdecyduje, czy 52 mln USD przełoży się na przywództwo w kategorii.