Modèles et plateformes d’IA
Fish Audio obtient 52 millions de dollars de financement pour convertir les modèles de voix ouverts en revenus

Fish Audio a levé 52 millions de dollars dans le cadre d’un cycle de financement initial co-dirigé par Coreline Ventures et Capital Today, un financement qui arrive chez une entreprise de text-to-speech de Palo Alto qui a passé l’année précédente à donner ses modèles et à facturer tout ce qui les entoure. Fish Audio déclare que plus de 8 millions de personnes utilisent désormais ces modèles via les versions open-weight ou sa plate-forme hébergée, et que l’entreprise génère 21 millions de dollars de revenus récurrents annuels.
Le cycle de financement a été annoncé le 28 juillet 2026, avec 359 Capital, la résidence de fondateurs HF0 et cinq autres fonds qui ont rejoint, et a été dévoilé pour la première fois par TechCrunch. Le PDG et co-fondateur Rissa Cao a déclaré que l’entreprise fonctionnait de manière suffisamment efficace sur la distribution open-source et les abonnements des créateurs pour ne pas avoir besoin de capitaux externes, et est allée chercher des fonds pour financer des modèles plus avancés et une poussée vers les comptes d’entreprise. Un cycle de financement de 52 millions de dollars toujours étiqueté comme une graine, dans une entreprise avec des revenus récurrents à huit chiffres, montre à quel point la voix est passée rapidement d’une fonctionnalité de produit à un poste de dépense d’infrastructure.
Des poids ouverts à une API gratuite
L’entreprise a commencé comme un projet secondaire de Shijia Liao, un ancien chercheur Nvidia (NVDA ) qui a formé un modèle de parole sur une seule GPU et l’a publié. Ce référentiel, Fish Speech, compte désormais plus de 31 000 étoiles et une communauté parmi les développeurs indépendants et les studios de jeux. Liao est le scientifique en chef de Fish Audio, et cinq modèles ont été expédiés en environ un an : quatre générateurs de parole et un système de parole à texte.
Trois des générateurs de parole sont ouverts. Fish Audio a publié les poids de S2 le 9 mars 2026, ainsi que le code de fine-tuning et un moteur d’inférence de streaming. S2 est un modèle de 4 milliards de paramètres formé sur plus de 10 millions d’heures d’audio dans environ 80 langues, guidé par des balises de style libre telles que [whisper] ou [ton de diffusion professionnelle] insérées au niveau du mot. L’entreprise compte plus de 15 000 de ces commandes.
Le modèle le plus récent, S2.1 Pro, est celui qu’il retient de la version open, et même celui-ci est actuellement gratuit sur l’API : pas de limite de caractères dure, 83 langues et aucune garantie de niveau de service, avec la fenêtre gratuite prolongée jusqu’au 31 août 2026. Les plans payants comportent des engagements de latence et de disponibilité, et l’entreprise demande aux produits d’une valeur supérieure à 1 million de dollars de revenus annuels récurrents de discuter avec elle avant de construire sur le niveau gratuit. Fish Audio attribue une pile d’inférence reconstruite, y compris sa propre bibliothèque de noyau GPU FP8, pour rendre ce don gratuit, et signale environ 70 millisecondes pour la première audio sur une seule demande.
C’est la logique commerciale de l’entreprise. Les poids ouverts et un modèle frontalier gratuit achètent la distribution parmi les développeurs ; les revenus proviennent des entreprises qui ont besoin de latence contractuelle. Fish Audio déclare que des clients d’entreprise, notamment HeyGen, Livekit, Retell, Sanas et OpenArt, utilisent déjà ses API, et Cao décrit la demande en fonction de l’utilisation : les produits d’avatar veulent du réalisme, les studios de jeux veulent des voix de personnages expressifs, et les sociétés d’agent de voix veulent une faible latence qui sonne encore humaine. Ce dernier segment est celui qui évolue le plus rapidement, à mesure que les assistants principaux ajoutent des interfaces parlées — Anthropic a apporté ses modèles Opus et Sonnet dans le mode vocal de Claude en juillet 2026 — et à mesure que les petits studios poursuivent le même créneau, notamment Tryll Engine avec des dialogues de jeu sur appareil.
Qui a écrit les chèques
Les deux chefs de file sont un duo inhabituel pour une entreprise de développement de logiciels américaine. Coreline Ventures est un petit fonds transfrontalier issu de DCM Ventures, écrivant des chèques précoces aux États-Unis, au Japon et en Corée à partir d’un portefeuille délibérément compact qui comprend déjà un laboratoire de voix générative japonais. Capital Today est la franchise Internet grand public chinoise que Kathy Xu a fondée en 2005, avec JD.com (JD ), Meituan, ByteDance et Moonshot AI parmi ses participations et un fonds evergreen d’environ 2,8 milliards de dollars. 359 Capital, qui s’est séparé de Sapphire Ventures en novembre 2025 avec environ 300 millions de dollars sous gestion, investit dans les entreprises de consommation et les entreprises adjacentes à la consommation. L’argent des consommateurs, en d’autres termes, soutient une API de développement, sur la théorie que la bibliothèque de voix communautaire est l’actif durable.
Osuke Honda, co-fondateur et associé directeur de Coreline, a posé une condition à cette théorie. “Une approche centrée sur la communauté ne peut devenir un avantage durable que si les créateurs font confiance à la plate-forme”, a-t-il déclaré dans la même interview. “Cela signifie que le consentement, la transparence et l’attribution doivent être intégrés dans le produit plutôt que traités comme des afterthoughts.”
La bibliothèque est fournie par l’utilisateur. Fish Audio demande aux gens de soumettre leurs propres voix pour la formation et les paie lorsqu’une voix est utilisée, et la bibliothèque publique compte désormais plus de deux millions de voix. Ce modèle a suscité des plaintes plus tôt en 2026, lorsque les créateurs ont déclaré que des voix avaient été téléchargées sans leur consentement et que les retraits se faisaient lentement. Le 4 juillet 2026, l’entreprise a documenté un processus de litige de propriété de voix qui remplace la file d’attente de support général : les réclamants déposent à partir de la page du modèle, soumettent une pièce d’identité gouvernementale ou une autorisation d’entreprise, et lisent une phrase de vérification à haute voix. Cao a déclaré que les suppressions sont maintenant effectuées en moins de trois minutes.
Qu’est-ce qui suit
Deux autres modèles sont en cours de route : un système de compréhension audio que l’entreprise prévoit pour cette année, et un modèle de parole à parole encore en développement. Les deux visent la pile d’agent de voix plutôt que la narration unidirectionnelle. La génération de parole est déjà un marché encombré, avec ElevenLabs, Cartesia, Speechify et Krisp vendant dans des ensembles de créateurs et de développeurs qui se chevauchent. Une augmentation de cette taille n’est plus l’outsider qu’elle aurait été il y a deux ans ; Enigma a ouvert un cycle de financement de 71 millions de dollars pour les interfaces de robot plus tôt en juillet 2026. Le test le plus proche pour Fish Audio est commercial : la fenêtre gratuite S2.1 Pro se ferme à la fin du mois d’août 2026, et le nouveau capital doit convertir les développeurs qu’il a attirés en contrats d’entreprise. comme l’outsider qu’il aurait été il y a deux ans ; Enigma a ouvert un cycle de financement de 71 millions de dollars pour les interfaces de robot plus tôt en juillet 2026. Le test le plus proche pour Fish Audio est commercial : la fenêtre gratuite S2.1 Pro se ferme à la fin du mois d’août 2026, et le nouveau capital doit convertir les développeurs qu’il a attirés en contrats d’entreprise.












