AI-modeller og plattformer
Fish Audio mottar 52 millioner dollar i seeds-kapital for å omdanne åpne talemodeller til inntekter

Fish Audio har samlet inn 52 millioner dollar i en seeds-runde ledet av Coreline Ventures og Capital Today, penger som kommer til et Palo Alto-basert tekst-til-tale-selskap som har brukt det siste året på å gi bort modellene sine og ta betalt for alt rundt dem. Fish Audio sier at over 8 millioner mennesker nå bruker disse modellene gjennom enten åpne vektfrigivelse eller deres vertede plattform, og at bedriften kjører med 21 millioner dollar i årlig gjentakende inntekt.
Runden ble offentliggjort 28. juli 2026, med 359 Capital, HF0-grunnleggerresidens og fem andre fonder som deltok, og ble først rapportert av TechCrunch. CEO og medgrunnlegger Rissa Cao sa at selskapet hadde kjørt effektivt nok på åpen kildekode-distribusjon og skaparabonnementer at det ikke trengte ekstern kapital, og gikk ut for å finansiere mer avanserte modeller og en fremstøt mot bedriftskunder. En 52 millioner dollar-runde som fortsatt bærer seeds-merket, i et selskap med åtte sifre i gjentakende inntekt, markerer hvor raskt tale flyttet fra et produkttrekk til en infrastrukturpost.
Fra åpne vekter til en gratis API
Selskapet startet som et sideprosjekt av Shijia Liao, en tidligere Nvidia (NVDA )-forsker som trente en talemodell på en enkelt GPU og publiserte den. Denne repositoryen, Fish Speech, har nå over 31 000 stjerner og en følger blant uavhengige utviklere og spillstudioer. Liao er Fish Audios sjefs vitenskapsmann, og fem modeller har blitt levert i løpet av omtrent ett år: fire tale-genereringer og ett tale-til-tekst-system.
Tre av tale-generatorene er ute i det åpne. Fish Audio publiserte S2-vektene 9. mars 2026, sammen med finjusteringskode og en strømmende inferensmotor. S2 er en 4-milliarder-parametere modell trent på over 10 millioner timer med audio på omtrent 80 språk, styrt av friteksttags som [whisper] eller [profesjonell kringkastningstone] droppet på ordnivå. Selskapet teller over 15 000 av disse kontrollene.
Den nyeste modellen, S2.1 Pro, er den som det holder tilbake fra åpen utgivelse, og selv den er nå gratis over API-en: ingen hard karaktergrense, 83 språk og ingen servicenivå-garanti, med den gratis-vinduet forlenget til 31. august 2026. Betalte planer har latency- og oppetid-kommitmenter, og selskapet ber produkter over 1 million dollar i årlig gjentakende inntekt om å snakke med dem før de bygger på den gratis tieren. Fish Audio krediterer en ombygget inferensstakk, inkludert sin egen FP8 GPU-kernelbibliotek, for å gjøre denne gaveaffordabel, og rapporterer omtrent 70 millisekunder til første audio på en enkelt forespørsel.
Dette er den kommersielle logikken bak bedriften. Åpne vekter og en gratis grensemodell kjøper distribusjon blant utviklere; inntekt kommer fra selskapene som trenger kontraktlatens. Fish Audio sier at bedriftskunder inkludert HeyGen, Livekit, Retell, Sanas og OpenArt allerede kjører på sine API-er, og Cao beskriver etterspørsel som splittet etter brukstilfelle: avatar-produkter ønsker realisme, spillstudioer ønsker uttrykksfulle karakterstemmer, og tale-agent-selskaper ønsker lav latency som fortsatt lyder menneskelig. Den siste delen er den som beveger seg raskest, ettersom mainstream-assistenter legger til tale-grensesnitt — Anthropic brakte sine Opus- og Sonnet-modeller inn i Claude-voice-mode i juli 2026 — og som mindre studioer jakter på samme nisje, inkludert Tryll Engine med på enhet-spill-dialog.
Hvem skrev sjekken
De to lederne er et uvanlig par for et US-utvikler-verktøyselskap. Coreline Ventures er en liten grenseoverskridende fond som ble spinnet ut fra DCM Ventures, som skriver tidlige sjekker over hele USA, Japan og Korea fra et bevisst kompaktt portefølje som allerede inkluderer et japansk generativt-voice-laboratorium. Capital Today er det kinesiske forbruker-internett-franchisen Kathy Xu grunnla i 2005, med JD.com (JD ), Meituan, ByteDance og Moonshot AI blant sine eiendommer og en evigvarende fond på omtrent 2,8 milliarder dollar. 359 Capital, som ble separert fra Sapphire Ventures i november 2025 med omtrent 300 millioner dollar under forvaltning, investerer i forbruker- og forbruker-nære bedrifter. Forbruker-penger, med andre ord, bak en utvikler-API, på teorien om at fellesskaps-lydbiblioteket er den varige eiendommen.
Osuke Honda, Corelines medgrunnlegger og managing partner, satte en betingelse på denne teorien. “En fellesskaps-sentrert tilnærming kan bare bli en varig fordel hvis skaperne stoler på plattformen,” sa han i samme intervju. “Det betyr at samtykke, transparens og tilskrivning må bygges inn i produktet i stedet for å behandles som ettertanker.”
Biblioteket er bruker-levert. Fish Audio ber mennesker om å sende inn sine egne stemmer for trening og betaler dem når en stemme blir brukt, og det offentlige biblioteket har nå over to millioner stemmer. Denne modellen trakk klager tidligere i 2026, da skapere sa at stemmer hadde blitt lastet opp uten deres samtykke og at fjerningene beveget seg sakte. 4. juli 2026 dokumenterte selskapet en dedikert stemme-eierskapsprosess som erstatter den generelle støttekøen: kravere sender fra modellens side, sender inn regjerings-ID eller bedriftsgodkjenning, og leser en verifiseringssetning høyt. Cao sa at fjerningene nå fullføres på under tre minutter.
Hva kommer neste
To modeller er på vei: et audio-forståelsessystem som selskapet forventer i år, og et tale-til-tale-modell som fortsatt er under utvikling. Begge retter seg mot tale-agent-stakken i stedet for envegs-narrasjon. Tale-generering er allerede et trangt marked, med ElevenLabs, Cartesia, Speechify og Krisp som selger inn i overlappende sett av skapere og utviklere. En økning denne størrelsen er ikke lenger den outlier det ville ha vært for to år siden; Enigma åpnet en 71 millioner dollar-seed for robot-grensesnitt tidligere i juli 2026. Den nærmere testen for Fish Audio er kommersiell: den gratis S2.1 Pro-vinduet lukker ved utgangen av august 2026, og den nye kapitalen må omdanne utviklerne det tiltrekker seg til bedriftskontrakter.












