Modele și platforme AI
Fish Audio atrage 52 de milioane de dolari pentru a transforma modelele vocale deschise în venituri

Fish Audio a strâns 52 de milioane de dolari într-o rundă de seed condusă de Coreline Ventures și Capital Today, bani care sosesc la o companie de text-to-speech din Palo Alto care a petrecut ultimul an dându-și modelele și taxând pentru tot ce este în jurul lor. Fish Audio spune că peste 8 milioane de oameni folosesc acum aceste modele prin lansările de greutate deschisă sau prin platforma sa găzduită, iar afacerea funcționează la 21 de milioane de dolari în venituri anuale recurente.
Runda a fost dezvăluită pe 28 iulie 2026, cu 359 Capital, rezidența fondatorilor HF0 și alte cinci fonduri care s-au alăturat, și a fost raportată pentru prima dată de TechCrunch. CEO-ul și co-fondatorul Rissa Cao a spus că compania a funcționat suficient de eficient pe baza distribuției open-source și a abonamentelor creatorilor, astfel încât nu a avut nevoie de capital extern, și a ieșit să finanțeze modele mai avansate și o împingere în conturile enterprise. O rundă de 52 de milioane de dolari care încă poartă eticheta de seed, la o companie cu venituri anuale recurente de opt cifre, marchează cât de repede a evoluat vocea de la o caracteristică a produsului la o linie de infrastructură.
De la greutăți deschise la un API gratuit
Compania a început ca un proiect lateral de către Shijia Liao, un fost cercetător Nvidia (NVDA ) care a antrenat un model de vorbire pe un singur GPU și l-a publicat. Acest depozit, Fish Speech, conține acum peste 31.000 de stele și o urmărire printre dezvoltatorii independenți și studiourile de jocuri. Liao este științificul șef al Fish Audio, și cinci modele au fost lansate în aproximativ un an: patru generatoare de vorbire și un sistem de vorbire-text.
Trei dintre generatoarele de vorbire sunt disponibile în mod deschis. Fish Audio a publicat greutățile S2 pe 9 martie 2026, împreună cu codul de finisare și un motor de inferență de streaming. S2 este un model de 4 miliarde de parametri antrenați pe peste 10 milioane de ore de audio în aproximativ 80 de limbi, condus de etichete libere precum [whisper] sau [ton profesional de difuziune] plasate în linie la nivel de cuvânt. Compania numără peste 15.000 de astfel de controale.
Noul model, S2.1 Pro, este cel pe care îl reține de la lansarea deschisă, și chiar acesta este în prezent gratuit prin API: fără limită dură de caractere, 83 de limbi și fără garanție de nivel de serviciu, cu fereastra gratuită prelungită până la 31 august 2026. Planurile plătite includ angajamente de latență și timp de funcționare, și compania solicită produse peste 1 milion de dolari în venituri anuale recurente să discute cu ea înainte de a se baza pe nivelul gratuit. Fish Audio atribuie o stivă de inferență reconstruită, inclusiv propria bibliotecă de kernel GPU FP8, pentru a face ca această dare să fie accesibilă, și raportează aproximativ 70 de milisecunde până la primul audio la o singură cerere.
Acesta este logica comercială a afacerii. Greutăți deschise și un model frontal gratuit cumpără distribuție printre dezvoltatori; veniturile provin de la companiile care au nevoie de latență contractuală. Fish Audio spune că clienții enterprise, inclusiv HeyGen, Livekit, Retell, Sanas și OpenArt, rulează deja pe API-urile sale, și Cao descrie cererea împărțită pe caz de utilizare: produsele de avatar doresc realism, studiourile de jocuri doresc voci de personaje expresive, și companiile de agenți vocali doresc latență scăzută care să sune încă uman. Acesta din urmă segment este cel care se mișcă cel mai rapid, pe măsură ce asistenții mainstream adaugă interfețe vorbite — Anthropic a adus modelele Opus și Sonnet în modul de voce Claude în iulie 2026 — și pe măsură ce studiourile mai mici urmăresc același nișă, inclusiv Tryll Engine cu personaje și conversații de inteligență artificială pe dispozitive pentru jocuri.
Cine a scris cecurile
Cei doi lideri sunt o pereche neobișnuită pentru o companie de unelte de dezvoltator din SUA. Coreline Ventures este un fond mic de frontieră, separat din DCM Ventures, care scrie cecuri inițiale în SUA, Japonia și Coreea, dintr-un portofoliu deliberat compact care include deja un laborator de voce generativă japonez. Capital Today este franciza de internet de consum din China pe care Kathy Xu a fondat-o în 2005, cu JD.com (JD ), Meituan, ByteDance și Moonshot AI printre deținători și un fond evergreen de aproximativ 2,8 miliarde de dolari. 359 Capital, care s-a separat de Sapphire Ventures în noiembrie 2025, cu aproximativ 300 de milioane de dolari sub administrare, investește în afaceri de consum și afaceri conexe consumatorilor. Bani de consum, în cuvinte, care susțin un API de dezvoltator, pe baza teoriei că biblioteca de voce a comunității este activele durabile.
Osuke Honda, co-fondator și partener gestionar al Coreline, a pus o condiție pe această teorie. “O abordare centrată pe comunitate poate deveni un avantaj durabil doar dacă creatorii au încredere în platformă”, a spus el în același interviu. “Asta înseamnă că consimțământul, transparența și atribuirea trebuie să fie integrate în produs, și nu tratate ca gânduri ulterioare”.
Biblioteca este furnizată de utilizatori. Fish Audio solicită oamenilor să își trimită propriile voci pentru antrenament și le plătește atunci când o voce este utilizată, și biblioteca publică conține acum peste două milioane de voci. Acest model a atras plângeri mai devreme în 2026, când creatorii au spus că voci au fost încărcate fără consimțământul lor și că înlăturările s-au mișcat lent. Pe 4 iulie 2026, compania a documentat un proces de dispută a proprietății vocale care înlocuiește coada generală de suport: reclamanții depun de pe pagina modelului, trimit o carte de identitate guvernamentală sau o autorizație corporativă și citesc o propoziție de verificare cu voce tare. Cao a spus că înlăturările se finalizează acum în sub trei minute.
Ce urmează
Două modele suplimentare sunt pe drum: un sistem de înțelegere a audio pe care compania îl așteaptă în acest an, și un model de vorbire-la-vorbire care este încă în dezvoltare. Ambele vizează stiva de agenți vocali, și nu nararea unilaterală. Generarea de vorbire este deja o piață aglomerată, cu ElevenLabs, Cartesia, Speechify și Krisp care vând în seturi suprapuse de creatori și dezvoltatori. O creștere de această dimensiune nu mai este un outlier cum ar fi fost acum doi ani; Enigma a deschis un seed de 71 de milioane de dolari pentru interfețe de robot mai devreme în iulie 2026. Testul mai apropiat pentru Fish Audio este comercial: fereastra gratuită S2.1 Pro se închide la sfârșitul lunii august 2026, și noul capital trebuie să convertească dezvoltatorii pe care i-a atras în contracte enterprise.












