Modele i platformy AI
Fish Audio pozyskał 52 mln dolarów na przekształcenie otwartych modeli głosowych w przychody

Fish Audio pozyskał 52 miliony dolarów w rundzie seed, której współliderami są Coreline Ventures i Capital Today, pieniądze, które przychodzą do firmy z siedzibą w Palo Alto, zajmującej się konwersją tekstu na mowę, która przez ostatni rok rozdawała swoje modele i pobierała opłaty za wszystko wokół nich. Fish Audio twierdzi, że ponad 8 milionów ludzi używa tych modeli za pośrednictwem wydań open-weight lub swojej platformy hostowanej, a firma generuje 21 milionów dolarów przychodu rocznego.
Runda została ujawniona 28 lipca 2026 r., z 359 Capital, funduszem HF0 founder residency i pięcioma innymi funduszami, które dołączyły, i została po raz pierwszy opisana przez TechCrunch. CEO i współzałożyciel Rissa Cao powiedział, że firma była wystarczająco wydajna, aby nie potrzebować zewnętrznych środków, i poszukiwała dodatkowych środków na bardziej zaawansowane modele i wejście na rynki przedsiębiorstw. Runda seed o wartości 52 milionów dolarów, w firmie z przychodem rocznym sięgającym ośmiu cyfr, pokazuje, jak szybko głos przeszedł od funkcji produktu do pozycji infrastruktury.
Od otwartych wag do bezpłatnego API
Firma powstała jako projekt poboczny Shijii Liao, byłego badacza Nvidia (NVDA ), który wytrenował model mowy na jednej karcie graficznej i opublikował go. To repozytorium, Fish Speech, ma ponad 31 000 gwiazd i grupę fanów wśród niezależnych deweloperów i studiów gier. Liao jest głównym naukowcem Fish Audio, a pięć modeli zostało wydanych w ciągu roku: cztery generatory mowy i jeden system konwersji mowy na tekst.
Trzy z generatorów mowy są dostępne publicznie. Fish Audio opublikowało wagi S2 9 marca 2026 r., wraz z kodem dostrajania i silnikiem inferencji strumieniowej. S2 to model 4-miliardowych parametrów wytrenowany na ponad 10 milionach godzin audio w około 80 językach, kierowany tagami wolnej formy, takimi jak [whisper] lub [professional broadcast tone], umieszczonymi na poziomie słowa. Firma liczy ponad 15 000 takich kontrol.
Najnowszy model, S2.1 Pro, jest tym, którego firma nie udostępnia publicznie, a nawet ten jest obecnie bezpłatny za pośrednictwem API: brak limitu znaków, 83 języki i brak gwarancji poziomu usługi, z oknem bezpłatnym przedłużonym do 31 sierpnia 2026 r. Płatne plany obejmują zobowiązania dotyczące opóźnień i czasu pracy, a firma prosi produkty o przychody powyżej 1 miliona dolarów, aby skontaktowały się z nią przed budowaniem na bezpłatnym poziomie. Fish Audio przypisuje sobie wybudowany stos inferencji, w tym własną bibliotekę jądra GPU FP8, za to, że taka darmowa oferta jest możliwa, i zgłasza około 70 milisekund do pierwszego dźwięku na jednej prośbie.
To jest logika biznesowa firmy. Otwarte wagi i bezpłatny model na granicy kupują dystrybucję wśród deweloperów; przychody pochodzą z firm, które potrzebują umownych opóźnień. Fish Audio twierdzi, że klienci przedsiębiorstw, w tym HeyGen, Livekit, Retell, Sanas i OpenArt, już korzystają z ich API, a Cao opisuje popyt, który dzieli się według przypadku użycia: produkty awatarów chcą realizmu, studia gier chcą wyrażających głosów postaci, a firmy agentów głosowych chcą niskich opóźnień, które nadal brzmią jak ludzki głos. Ten ostatni segment to ten, który rozwija się najszybciej, ponieważ asystenci głosowi dodają interfejsy mówione — Anthropic wprowadził swoje modele Opus i Sonnet do trybu głosowego Claude w lipcu 2026 r. — i mniejsze studia ścigają ten sam niszę, w tym Tryll Engine z dialogami gier na urządzeniu.
Kto napisał czeki
Dwóch liderów to niezwykłe połączenie dla amerykańskiej firmy deweloperskiej. Coreline Ventures to mały fundusz transgraniczny, który wydzielił się z DCM Ventures, piszący wczesne czeki w Stanach Zjednoczonych, Japonii i Korei z celowo kompaktowego portfela, który już obejmuje japońskie laboratorium głosów generatywnych. Capital Today to chińska firma konsumencka, którą Kathy Xu założyła w 2005 r., z JD.com (JD ), Meituan, ByteDance i Moonshot AI wśród swoich posiadłości i funduszem evergreen o wartości około 2,8 miliarda dolarów. 359 Capital, który oddzielił się od Sapphire Ventures w listopadzie 2025 r. z około 300 milionami dolarów pod zarządzaniem, inwestuje w firmy konsumenckie i pokrewne. Środki konsumenckie, innymi słowy, wspierające API deweloperskie, oparte na tezie, że biblioteka głosów społeczności jest trwałym aktywem.
Osuke Honda, współzałożyciel i zarządzający Coreline, postawił warunek tej tezy. “Podejście ukierunkowane na społeczność może stać się trwałą przewagą tylko wtedy, gdy twórcy ufają platformie”, powiedział w tym samym wywiadzie. “To oznacza, że zgoda, przejrzystość i atrybucja muszą być wbudowane w produkt, a nie traktowane jako pomyślne.”
Biblioteka jest dostarczana przez użytkowników. Fish Audio prosi ludzi o przesłanie własnych głosów do szkolenia i płaci im, gdy głos jest używany, a publiczna biblioteka zawiera obecnie ponad dwa miliony głosów. Ten model wywołał skargi wcześniej w 2026 r., gdy twórcy powiedzieli, że głosy zostały przesłane bez ich zgody i że usunięcia przebiegały powoli. 4 lipca 2026 r. firma udokumentowała dedykowany proces rozstrzygania sporów dotyczących własności głosu, który zastępuje ogólny kolejkę wsparcia: osoby składające wnioski składają wnioski ze strony modelu, przedkładają rządowe ID lub upoważnienie korporacyjne i czytają zdanie weryfikacyjne na głos. Cao powiedział, że usunięcia są teraz wykonywane w ciągu moins niż trzech minut.
Co jest planowane
Dwa kolejne modele są na mapie drogowej: system zrozumienia audio, którego firma oczekuje w tym roku, i model mowy na mowę, który jest nadal w fazie rozwoju. Obie są skierowane do stosu agentów głosowych, a nie do narracji jednokierunkowej. Generowanie mowy jest już rynkiem, na którym dominują ElevenLabs, Cartesia, Speechify i Krisp, sprzedający do nakładających się się zbiorów twórców i deweloperów. Podniesienie takiego rozmiaru jest już nie jest wyjątkiem, jakim byłoby dwa lata temu; Enigma otworzył 71-milionowy seed dla interfejsów robota wcześniej w lipcu 2026 r. Bliski test dla Fish Audio jest komercyjny: bezpłatne okno S2.1 Pro zamyka się na koniec sierpnia 2026 r., a nowy kapitał musi przekształcić deweloperów, których przyciągnęło, w umowy przedsiębiorstw.












