Modelos e plataformas de IA
Fish Audio Recebe US$ 52 Milhões em Financiamento de Semente para Transformar Modelos de Voz Abertos em Receita

A Fish Audio arrecadou US$ 52 milhões em uma rodada de financiamento de semente co-liderada pela Coreline Ventures e Capital Today, dinheiro que chega a uma empresa de texto-para-fala de Palo Alto que passou o último ano distribuindo seus modelos gratuitamente e cobrando por tudo ao seu redor. A Fish Audio afirma que mais de 8 milhões de pessoas agora usam esses modelos por meio das versões de pesos abertos ou de sua plataforma hospedada, e que o negócio está gerando US$ 21 milhões em receita recorrente anual.
A rodada foi divulgada em 28 de julho de 2026, com a 359 Capital, a residência de fundadores da HF0 e mais cinco fundos se juntando, e foi primeiramente relatada pelo TechCrunch. A CEO e co-fundadora Rissa Cao disse que a empresa estava funcionando de forma eficiente o suficiente com a distribuição de código aberto e assinaturas de criadores que não precisava de capital externo, e foi em busca de financiamento para desenvolver modelos mais avançados e uma incursão em contas empresariais. Uma rodada de US$ 52 milhões ainda com o rótulo de semente, em uma empresa com receita recorrente de oito dígitos, marca como a voz se moveu rapidamente de um recurso de produto para um item de infraestrutura.
De pesos abertos a uma API gratuita
A empresa começou como um projeto paralelo de Shijia Liao, um ex-pesquisador da Nvidia (NVDA ) que treinou um modelo de fala em uma única GPU e o publicou. Esse repositório, Fish Speech, agora tem mais de 31.000 estrelas e uma comunidade entre desenvolvedores independentes e estúdios de jogos. Liao é o cientista-chefe da Fish Audio, e cinco modelos foram lançados em aproximadamente um ano: quatro geradores de fala e um sistema de fala-para-texto.
Três dos geradores de fala estão disponíveis gratuitamente. A Fish Audio publicou os pesos do S2 em 9 de março de 2026, juntamente com o código de fine-tuning e um motor de inferência de streaming. O S2 é um modelo de 4 bilhões de parâmetros treinado em mais de 10 milhões de horas de áudio em cerca de 80 idiomas, orientado por tags de forma livre, como [sussurro] ou [tom de transmissão profissional] inseridas inline no nível da palavra. A empresa conta com mais de 15.000 desses controles.
O modelo mais recente, S2.1 Pro, é o que a empresa retém da liberação aberta, e mesmo assim está disponível gratuitamente por meio da API: sem limite de caracteres rígido, 83 idiomas e sem garantia de nível de serviço, com a janela gratuita estendida até 31 de agosto de 2026. Os planos pagos incluem compromissos de latência e tempo de atividade, e a empresa solicita que produtos acima de US$ 1 milhão em receita recorrente anual (ARR) entrem em contato com a empresa antes de construir sobre o nível gratuito. A Fish Audio credita uma pilha de inferência reconstruída, incluindo sua própria biblioteca de kernel de GPU FP8, por tornar essa doação acessível, e relata cerca de 70 milissegundos para o primeiro áudio em uma solicitação única.
Essa é a lógica comercial do negócio. Pesos abertos e um modelo de fronteira gratuita compram distribuição entre desenvolvedores; a receita vem das empresas que precisam de latência contratual. A Fish Audio afirma que clientes empresariais incluindo HeyGen, Livekit, Retell, Sanas e OpenArt já executam suas APIs, e Cao descreve a demanda dividida por caso de uso: produtos de avatar desejam realismo, estúdios de jogos desejam vozes de personagens expressivas, e empresas de agente de voz desejam latência baixa que ainda soe humana. Esse último segmento é o que está se movendo mais rapidamente, à medida que assistentes mainstream adicionam interfaces faladas — Anthropic trouxe seus modelos Opus e Sonnet para o modo de voz do Claude em julho de 2026 — e à medida que estúdios menores perseguem a mesma nicho, incluindo Tryll Engine com diálogos de jogos em dispositivo.
Quem escreveu os cheques
Os dois líderes são um par incomum para uma empresa de ferramentas de desenvolvedor dos EUA. A Coreline Ventures é um pequeno fundo transfronteiriço spin-off da DCM Ventures, escrevendo cheques iniciais nos EUA, Japão e Coreia a partir de um portfólio deliberadamente compacto que já inclui um laboratório de voz gerativa japonês. A Capital Today é a franquia de internet de consumo da China fundada por Kathy Xu em 2005, com JD.com (JD ), Meituan, ByteDance e Moonshot AI entre suas participações e um fundo evergreen de aproximadamente US$ 2,8 bilhões. A 359 Capital, que se separou da Sapphire Ventures em novembro de 2025 com cerca de US$ 300 milhões sob gestão, investe em negócios de consumo e adjacentes ao consumo. Dinheiro de consumo, em outras palavras, apoiando uma API de desenvolvedor, com base na teoria de que a biblioteca de voz da comunidade é o ativo durável.
Osuke Honda, co-fundador e sócio gerente da Coreline, impôs uma condição a essa teoria. “Uma abordagem centrada na comunidade só pode se tornar uma vantagem durável se os criadores confiam na plataforma”, disse ele na mesma entrevista. “Isso significa que consentimento, transparência e atribuição devem ser incorporados ao produto, e não tratados como afterthoughts.”
A biblioteca é fornecida pelo usuário. A Fish Audio pede às pessoas que forneçam suas próprias vozes para treinamento e paga quando uma voz é usada, e a biblioteca pública agora contém mais de dois milhões de vozes. Esse modelo gerou reclamações no início de 2026, quando criadores disseram que vozes haviam sido carregadas sem o seu consentimento e que as retiradas se moviam lentamente. Em 4 de julho de 2026, a empresa documentou um processo de disputa de propriedade de voz que substitui a fila de suporte geral: reclamantes arquivam a partir da página do modelo, enviam identificação governamental ou autorização corporativa e leem uma frase de verificação em voz alta. Cao disse que as remoções agora são concluídas em menos de três minutos.
O que vem a seguir
Dois modelos estão no roadmap: um sistema de compreensão de áudio que a empresa espera para este ano, e um modelo de fala-para-fala ainda em desenvolvimento. Ambos visam a pilha de agente de voz, e não a narração unidirecional. A geração de fala já é um mercado lotado, com ElevenLabs, Cartesia, Speechify e Krisp vendendo para conjuntos sobrepostos de criadores e desenvolvedores. Uma captação desse tamanho já não é mais o outlier que teria sido dois anos atrás; Enigma abriu uma semente de US$ 71 milhões para interfaces de robô mais cedo em julho de 2026. O teste mais próximo para a Fish Audio é comercial: a janela gratuita do S2.1 Pro fecha no final de agosto de 2026, e o novo capital precisa converter os desenvolvedores que atraiu em contratos empresariais. como o outlier que teria sido dois anos atrás; Enigma abriu uma semente de US$ 71 milhões para interfaces de robô mais cedo em julho de 2026. O teste mais próximo para a Fish Audio é comercial: a janela gratuita do S2.1 Pro fecha no final de agosto de 2026, e o novo capital precisa converter os desenvolvedores que atraiu em contratos empresariais.












