Modelli e piattaforme di IA

Fish Audio ottiene 52 milioni di dollari di seed per trasformare i modelli vocali open in entrate

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Fish Audio ha raccolto 52 milioni di dollari in una fase di seed guidata da Coreline Ventures e Capital Today, denaro che arriva in una società di Palo Alto che si occupa di text-to-speech e che ha trascorso l’ultimo anno distribuendo gratuitamente i suoi modelli e facendo pagare per tutto ciò che li circonda. Fish Audio afferma che più di 8 milioni di persone utilizzano ora quei modelli attraverso le release di open-weight o la sua piattaforma ospitata, e che l’attività è in funzione con 21 milioni di dollari di entrate ricorrenti annuali.

Il round è stato reso noto il 28 luglio 2026, con 359 Capital, il fondatore di HF0 e altri cinque fondi che si sono uniti, e è stato prima segnalato da TechCrunch. Il CEO e co-fondatore Rissa Cao ha affermato che la società stava funzionando in modo sufficientemente efficiente con la distribuzione open-source e le iscrizioni dei creatori, quindi non aveva bisogno di capitali esterni, e ha deciso di finanziare modelli più avanzati e di spingere verso gli account aziendali. Un round di 52 milioni di dollari che porta ancora l’etichetta di seed, in una società con entrate ricorrenti a otto cifre, segna quanto velocemente la voce sia passata da una caratteristica del prodotto a un elemento di infrastruttura.

Dai pesi aperti a un’API gratuita

La società è iniziata come un progetto laterale di Shijia Liao, un ex ricercatore di Nvidia (NVDA ) che ha addestrato un modello di parlato su una sola GPU e lo ha pubblicato. Quel repository, Fish Speech, ora conta più di 31.000 stelle e un seguito tra gli sviluppatori indipendenti e gli studi di gioco. Liao è il chief scientist di Fish Audio, e cinque modelli sono stati rilasciati in circa un anno: quattro generatori di parlato e un sistema di riconoscimento vocale.

Tre dei generatori di parlato sono aperti. Fish Audio ha pubblicato i pesi di S2 il 9 marzo 2026, insieme al codice di fine-tuning e a un motore di inferenza in streaming. S2 è un modello da 4 miliardi di parametri addestrato su più di 10 milioni di ore di audio in circa 80 lingue, guidato da tag a forma libera come [whisper] o [tono di trasmissione professionale] inseriti a livello di parola. La società conta più di 15.000 di quei controlli.

Il modello più recente, S2.1 Pro, è quello che tiene indietro dal rilascio aperto, e anche quello è attualmente gratuito sull’API: nessun limite di caratteri, 83 lingue e nessun impegno di livello di servizio, con la finestra gratuita estesa fino al 31 agosto 2026. I piani a pagamento prevedono impegni di latenza e di tempo di attività, e la società chiede ai prodotti con più di 1 milione di dollari di entrate ricorrenti annuali di parlare con loro prima di costruire sul piano gratuito. Fish Audio accredita una pila di inferenza ricostruita, compresa la sua libreria di kernel GPU FP8, per aver reso quel regalo accessibile, e segnala circa 70 millisecondi per il primo audio su una richiesta.

Questo è il logico commerciale dell’attività. I pesi aperti e un modello di frontiera gratuito comprano la distribuzione tra gli sviluppatori; le entrate provengono dalle società che necessitano di latenza contrattuale. Fish Audio afferma che clienti aziendali come HeyGen, Livekit, Retell, Sanas e OpenArt già utilizzano le sue API, e Cao descrive la domanda divisa per caso d’uso: i prodotti di avatar desiderano realismo, gli studi di gioco desiderano voci di personaggi espressivi, e le società di agenti vocali desiderano bassa latenza che suoni ancora umana. Quest’ultimo segmento è quello che si muove più velocemente, poiché gli assistenti mainstream aggiungono interfacce vocali — Anthropic ha portato i suoi modelli Opus e Sonnet nella modalità vocale di Claude nel luglio 2026 — e poiché gli studi più piccoli inseguono la stessa nicchia, compreso Tryll Engine con dialoghi di gioco su dispositivo.

Chi ha scritto gli assegni

I due leader sono una coppia insolita per una società di strumenti di sviluppo statunitense. Coreline Ventures è un fondo transnazionale di piccole dimensioni scaturito da DCM Ventures, che scrive assegni iniziali negli Stati Uniti, in Giappone e in Corea da un portfolio deliberatamente compatto che include già un laboratorio di voce generativa giapponese. Capital Today è la franchigia di internet dei consumatori cinesi fondata da Kathy Xu nel 2005, con JD.com (JD ), Meituan, ByteDance e Moonshot AI tra i suoi titoli e un fondo evergreen di circa 2,8 miliardi di dollari. 359 Capital, che si è separato da Sapphire Ventures nel novembre 2025 con circa 300 milioni di dollari di gestione, investe in aziende di consumo e aziende adiacenti ai consumatori. Denaro dei consumatori, in altre parole, a sostegno di un’API per sviluppatori, sulla teoria che la libreria di voci della comunità sia l’asset duraturo.

Osuke Honda, co-fondatore e managing partner di Coreline, ha posto una condizione a quella teoria. “Un approccio centrato sulla comunità può diventare un vantaggio duraturo solo se i creatori si fidano della piattaforma”, ha affermato nella stessa intervista. “Ciò significa che il consenso, la trasparenza e l’attribuzione devono essere costruiti nel prodotto e non trattati come afterthoughts.”

La libreria è fornita dagli utenti. Fish Audio chiede alle persone di inviare le proprie voci per l’addestramento e le paga quando una voce viene utilizzata, e la libreria pubblica ora contiene più di due milioni di voci. Quel modello ha sollevato reclami all’inizio del 2026, quando i creatori hanno affermato che le voci erano state caricate senza il loro consenso e che i ritiri si muovevano lentamente. Il 4 luglio 2026 la società ha documentato un processo di disputa sulla proprietà della voce che sostituisce la coda di supporto generale: i richiedenti presentano la richiesta dalla pagina del modello, inviano un documento di identità del governo o un’autorizzazione aziendale, e leggono una frase di verifica ad alta voce. Cao ha affermato che i rimozioni ora si completano in meno di tre minuti.

Cosa arriverà dopo

Due modelli sono sulla roadmap: un sistema di comprensione audio che la società si aspetta entro la fine dell’anno, e un modello di parlato-parlato ancora in fase di sviluppo. Entrambi sono rivolti allo stack di agenti vocali piuttosto che alla narrazione unidirezionale. La generazione di parlato è già un mercato affollato, con ElevenLabs, Cartesia, Speechify e Krisp che vendono in insiemi sovrapposti di creatori e sviluppatori. Un aumento di questa dimensione non è più l’eccezione che sarebbe stata due anni fa; Enigma ha aperto un seed di 71 milioni di dollari per le interfacce dei robot all’inizio di luglio 2026. La prova più vicina per Fish Audio è commerciale: la finestra gratuita di S2.1 Pro si chiude alla fine di agosto 2026, e il nuovo capitale deve convertire gli sviluppatori che ha attirato in contratti aziendali. Il test più vicino per Fish Audio è commerciale: la finestra gratuita di S2.1 Pro si chiude alla fine di agosto 2026, e il nuovo capitale deve convertire gli sviluppatori che ha attirato in contratti aziendali. come Enigma aprì un seed di 71 milioni di dollari per le interfacce dei robot all’inizio di luglio 2026. La prova più vicina per Fish Audio è commerciale: la finestra gratuita di S2.1 Pro si chiude alla fine di agosto 2026, e il nuovo capitale deve convertire gli sviluppatori che ha attirato in contratti aziendali.

Evan Mercer è un corrispondente generato da intelligenza artificiale presso Unite.AI, che copre startup di intelligenza artificiale, venture capital e la dinamica di finanziamento che plasma la prossima generazione di aziende tecnologiche. Le sue segnalazioni si concentrano sull'innovazione di primo stadio, sui flussi di capitale e sulle decisioni strategiche che i fondatori e gli investitori prendono mentre le aziende di intelligenza artificiale crescono da un concetto a un impatto globale.
Con una lente strategica e analitica, Evan esamina i round di finanziamento, la posizionamento sul mercato e le tendenze emergenti in tutto l'ecosistema delle startup di intelligenza artificiale. Egli segue come il venture capital, gli investimenti aziendali e i mercati pubblici si intersecano con i progressi nell'intelligenza artificiale, separando i segnali duraturi dall'ipotesi a breve termine.
Gli articoli scritti da Evan Mercer sono generati da intelligenza artificiale e revisionati dal team editoriale di Unite.AI per garantire accuratezza, contesto e copertura responsabile del paesaggio di investimento in intelligenza artificiale a livello globale