Modely a platformy AI
Fish Audio Získalo 52 Milionů dolarů Seed Investice na Převod Otevřených Hlasových Modelů na Příjem

Společnost Fish Audio získala 52 milionů dolarů v rámci seed kola, které vedly Coreline Ventures a Capital Today, peníze, které přicházejí do paloaltské text-to-speech společnosti, která strávila minulý rok rozdáváním svých modelů a účtováním za všechno kolem nich. Fish Audio uvádí, že více než 8 milionů lidí nyní používá tyto modely prostřednictvím otevřených váh nebo své hostované platformy a že podnikání běží na 21 milionů dolarů v ročních opakujících se příjmech.
Kolo bylo zveřejněno 28. července 2026, s 359 Capital, zakladatelem HF0 a pěti dalšími fondy, a bylo poprvé hlášeno TechCrunchem. Generální ředitel a spoluzakladatel Rissa Cao řekl, že společnost byla dostatečně efektivní na otevřené distribuci a předplatných tvůrců, aby nevyžadovala vnější kapitál, a šla ven, aby financovala pokročilejší modely a vstup do podnikových účtů. Kolo ve výši 52 milionů dolarů, které stále nese označení seed, u společnosti s osmimístnými opakujícími se příjmy, ukazuje, jak rychle se hlas pohyboval z produktové funkce na položku infrastruktury.
Od otevřených váh k bezplatnému API
Společnost začala jako vedlejší projekt Shijia Liao, bývalého výzkumníka Nvidia (NVDA ), který vyškolil model řeči na jediném GPU a zveřejnil ho. Ten repozitář, Fish Speech, nyní obsahuje více než 31 000 hvězd a následovníky mezi nezávislými vývojáři a herními studii. Liao je hlavním vědcem Fish Audio a pět modelů bylo dodáno za zhruba rok: čtyři generátory řeči a jeden systém pro převod řeči na text.
Tři z generátorů řeči jsou venku. Fish Audio zveřejnilo váhy S2 9. března 2026, spolu s kódem pro jemné ladění a streamovací inferenční motor. S2 je model s 4 miliardami parametrů, který byl vyškolil na více než 10 milionech hodinách audio ve zhruba 80 jazycích, řízený volnými značkami, jako je [whisper] nebo [professional broadcast tone], které se používají na úrovni slov. Společnost počítá více než 15 000 těchto ovladačů.
Nejnovější model, S2.1 Pro, je ten, který drží zpátky z otevřeného vydání, a dokonce i ten je aktuálně bezplatný přes API: bez tvrdého limitu znaků, 83 jazyků a bez záruky služby, s bezplatným oknem prodlouženým do 31. srpna 2026. Placené plány obsahují závazky latence a dostupnosti, a společnost žádá produkty nad 1 milion dolarů v ARR, aby se s ní spojily před tím, než budou stavět na bezplatné úrovni. Fish Audio připisuje přestavěný inferenční zásobník, včetně své vlastní knihovny FP8 GPU, za to, že tato bezplatná nabídka je dostupná, a uvádí, že trvá přibližně 70 milisekund, než se dostane k prvnímu audio na jeden požadavek.
To je komerční logika podnikání. Otevřené váhy a bezplatný model na hranici koupí distribuci mezi vývojáři; příjem pochází z firem, které potřebují smluvní latenci. Fish Audio uvádí, že podnikové zákazníky, včetně HeyGen, Livekit, Retell, Sanas a OpenArt, již běží na svých API, a Cao popisuje poptávku, která se dělí podle případu použití: produkty avatarů chtějí realistiku, herní studia chtějí expresivní charakteristické hlasy a společnosti pro hlasové agenty chtějí nízkou latenci, která stále zní lidsky. Ta poslední část je ta, která se pohybuje nejrychleji, protože hlavní asistenti přidávají mluvené rozhraní — Anthropic přinesl své modely Opus a Sonnet do režimu Voice Claude v červenci 2026 — a menší studia pronásledují stejnou niši, včetně Tryll Engine s herními dialogy na zařízení.
Kdo napsal šeky
Dvě hlavní společnosti jsou neobvyklým párem pro americkou společnost pro vývojáře. Coreline Ventures je malý fond s přeshraničním portfoliem, který píše časná šeky napříč USA, Japonskem a Koreou z úmyslně kompaktního portfolia, které již zahrnuje japonskou laboratoř generativního hlasu. Capital Today je čínská spotřebitelská internetová franšíza, kterou Kathy Xu založila v roce 2005, s JD.com (JD ), Meituan, ByteDance a Moonshot AI mezi svými držbami a evergreen fondem přibližně 2,8 miliardy dolarů. 359 Capital, který se oddělil od Sapphire Ventures v listopadu 2025 s přibližně 300 miliony dolarů pod správou, investuje do spotřebitelských a spotřebitelsky příbuzných podniků. Spotřebitelské peníze, slovy jiných, podporují vývojářskou API, na teorii, že komunitní hlasová knihovna je trvalým aktivem.
Osuke Honda, spoluzakladatel a manažer Coreline, stanovil podmínku pro tuto teorii. “Komunitně orientovaný přístup může být trvalou výhodou pouze tehdy, pokud tvůrci důvěřují platformě,” řekl ve stejném rozhovoru. “To znamená, že souhlas, transparentnost a atribuce musí být součástí produktu, nikoli pouze následným doplňkem.”
Knihovna je dodávána uživateli. Fish Audio žádá lidi, aby odeslali své vlastní hlasy pro školení a platí jim, když je hlas použit, a veřejná knihovna nyní obsahuje více než dva miliony hlasů. Ten model vyvolal stížnosti dříve v roce 2026, kdy tvůrci říkali, že hlasy byly nahrány bez jejich souhlasu a že stížnosti se pohybovaly pomalu. Dne 4. července 2026 společnost zdokumentovala speciální proces pro řešení sporů o vlastnictví hlasu, který nahrazuje obecnou frontu podpory: žadatelé podávají žádost ze stránky modelu, předkládají vládní ID nebo firemní autorizaci a čtou ověřovací větu nahlas. Cao řekl, že odstranění nyní probíhá za méně než tři minuty.
Co se bude dodávat dál
Dva další modely jsou na cestě: audio-porozumění systém, který společnost očekává letos, a model pro převod řeči na řeč, který je stále ve vývoji. Oba cílí na hlasový agentní zásobník, nikoli na jednosměrnou narraci. Generování řeči je již přeplněný trh, s ElevenLabs, Cartesia, Speechify a Krisp prodávajícími se do překrývajících se sad tvůrců a vývojářů. Zvýšení této velikosti již není outlier, jaký by byl před dvěma lety; Enigma otevřela 71milionový seed pro robotní rozhraní dříve v červenci 2026. Blíže test pro Fish Audio je komerční: bezplatné okno S2.1 Pro se uzavírá na konci srpna 2026, a nový kapitál musí převést vývojáře, které přilákal, do podnikových smluv.












