KI-Modelle und Plattformen

Fish Audio erhält 52 Millionen US-Dollar Seed-Finanzierung, um offene Sprachmodelle in Umsatz umzuwandeln

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Fish Audio hat 52 Millionen US-Dollar in einer Seed-Runde aufgenommen, die von Coreline Ventures und Capital Today gemeinsam geleitet wird. Das Geld kommt bei einem Text-to-Speech-Unternehmen in Palo Alto an, das im vergangenen Jahr seine Modelle kostenlos zur Verfügung gestellt und für alles andere Geld verlangt hat. Fish Audio sagt, dass mehr als 8 Millionen Menschen diese Modelle über die offenen Gewichtsveröffentlichungen oder seine gehostete Plattform nutzen, und dass das Unternehmen ein jährliches Umsatzvolumen von 21 Millionen US-Dollar erzielt.

Die Runde wurde am 28. Juli 2026 bekannt gegeben, mit 359 Capital, der HF0-Gründerresidenz und fünf anderen Fonds, die beitraten, und wurde erstmals von TechCrunch berichtet. CEO und Mitgründerin Rissa Cao sagte, dass das Unternehmen effizient genug auf offener Quellcode-Verteilung und Creator-Abonnements lief, um keine externen Mittel zu benötigen, und dass es losging, um fortgeschrittenere Modelle und einen Schritt in die Unternehmenskonten zu finanzieren. Eine 52-Millionen-US-Dollar-Runde, die immer noch den Seed-Label trägt, bei einem Unternehmen mit achtstelligen Umsätzen, zeigt, wie schnell die Stimme von einem Produktmerkmal zu einem Infrastrukturposten wurde.

Von offenen Gewichten zu einer kostenlosen API

Das Unternehmen begann als Nebenprojekt von Shijia Liao, einem ehemaligen Nvidia-Forscher, der ein Sprachmodell auf einer einzelnen GPU trainierte und veröffentlichte. Dieses Repository, Fish Speech, hat jetzt mehr als 31.000 Sterne und eine Anhängerschaft unter Indie-Entwicklern und Spielstudios. Liao ist der Chef-Wissenschaftler von Fish Audio, und fünf Modelle sind in etwa einem Jahr ausgeliefert worden: vier Sprachgeneratoren und ein Sprach-zu-Text-System.

Drei der Sprachgeneratoren sind offen zugänglich. Fish Audio veröffentlichte S2s Gewichte am 9. März 2026, zusammen mit Feinabstimmungscode und einem Streaming-Inferenz-Engine. S2 ist ein 4-Milliarden-Parameter-Modell, das auf mehr als 10 Millionen Stunden Audio in etwa 80 Sprachen trainiert wurde, gesteuert durch freie Formulare wie [whisper] oder [professioneller Broadcast-Ton], die inline auf Wortebene abgelegt werden. Das Unternehmen zählt mehr als 15.000 dieser Steuerungen.

Das neueste Modell, S2.1 Pro, ist das, das es von der offenen Veröffentlichung zurückhält, und sogar das ist derzeit kostenlos über die API: keine harte Zeichengrenze, 83 Sprachen und keine Service-Level-Garantie, mit dem kostenlosen Fenster bis zum 31. August 2026 verlängert. Bezahlte Pläne enthalten die Latenz- und Uptime-Verpflichtungen, und das Unternehmen bittet Produkte über 1 Million US-Dollar Umsatz, vor dem Aufbau auf der kostenlosen Ebene mit ihm zu sprechen. Fish Audio führt eine neu aufgebaute Inferenz-Engine, einschließlich seiner eigenen FP8-GPU-Kernel-Bibliothek, für die Machbarkeit dieses Geschenks an und berichtet über etwa 70 Millisekunden bis zum ersten Audio bei einer einzelnen Anfrage.

Das ist die kommerzielle Logik des Geschäfts. Offene Gewichte und ein kostenloses Frontier-Modell kaufen Verteilung unter Entwicklern; Umsatz kommt von den Unternehmen, die vertragliche Latenz benötigen. Fish Audio sagt, dass Unternehmenskunden wie HeyGen, Livekit, Retell, Sanas und OpenArt bereits auf seinen APIs laufen, und Cao beschreibt die Nachfrage, die sich nach Anwendungsfall teilt: Avatar-Produkte wollen Realismus, Spielstudios wollen ausdrucksstarke Charakterstimmen, und Sprachagenten-Unternehmen wollen niedrige Latenz, die dennoch menschlich klingt. Letzteres ist der Abschnitt, der am schnellsten wächst, da Mainstream-Assistenten gesprochene Schnittstellen hinzufügen – Anthropic brachte seine Opus- und Sonnet-Modelle in Claudes Sprachmodus im Juli 2026 – und da kleinere Studios dieselbe Nische verfolgen, einschließlich Tryll Engine mit On-Device-Spiel-Dialog.

Wer schrieb die Schecks

Die beiden Leiter sind ein ungewöhnliches Paar für ein US-Entwickler-Tools-Unternehmen. Coreline Ventures ist ein kleiner grenzüberschreitender Fonds, der aus DCM Ventures gespalten wurde, der frühe Schecks in den USA, Japan und Korea aus einem bewusst kompakten Portfolio schreibt, das bereits ein japanisches generatives Stimmlabor enthält. Capital Today ist die China-Verbraucher-Internet-Marke, die Kathy Xu 2005 gegründet hat, mit JD.com (JD ), Meituan, ByteDance und Moonshot AI unter ihren Beteiligungen und einem ewigen Fonds von etwa 2,8 Milliarden US-Dollar. 359 Capital, das im November 2025 von Sapphire Ventures mit etwa 300 Millionen US-Dollar unter Verwaltung getrennt wurde, investiert in Verbraucher- und verbraucherbezogene Unternehmen. Verbrauchergeld, mit anderen Worten, unterstützt eine Entwickler-API, basierend auf der Theorie, dass die Community-Stimmbibliothek das dauerhafte Vermögen ist.

Osuke Honda, Corelines Co-Gründer und Managing Partner, stellte eine Bedingung für diese Theorie. “Ein community-zentrierter Ansatz kann nur dann ein dauerhafter Vorteil werden, wenn die Ersteller der Plattform vertrauen”, sagte er in demselben Interview. “Das bedeutet, dass Zustimmung, Transparenz und Zuschreibung in das Produkt einbezogen werden müssen, anstatt als Nachgedanke behandelt zu werden.”

Die Bibliothek ist benutzerdefiniert. Fish Audio bittet Menschen, ihre eigenen Stimmen für die Ausbildung einzureichen und zahlt ihnen, wenn eine Stimme verwendet wird, und die öffentliche Bibliothek enthält jetzt mehr als zwei Millionen Stimmen. Dieses Modell zog früher im Jahr 2026 Beschwerden nach sich, als Ersteller sagten, dass Stimmen ohne ihre Zustimmung hochgeladen worden seien und dass die Entfernungen langsam voranschritten. Am 4. Juli 2026 dokumentierte das Unternehmen einen dedizierten Stimmeigentumsstreitprozess, der die allgemeine Support-Warteschlange ersetzt: Antragsteller reichen von der Modellseite aus, legen eine Regierungs-ID oder eine Unternehmensautorisierung vor und lesen einen Verifizierungssatz vor. Cao sagte, dass die Entfernungen jetzt in weniger als drei Minuten abgeschlossen seien.

Was kommt als nächstes

Zwei weitere Modelle sind auf der Roadmap: ein Audio-Verständnis-System, das das Unternehmen in diesem Jahr erwartet, und ein Sprach-zu-Sprach-Modell, das noch in der Entwicklung ist. Beide zielen auf den Sprachagenten-Stack ab, anstatt auf einseitige Erzählung. Sprachgenerierung ist bereits ein überfüllter Markt, mit ElevenLabs, Cartesia, Speechify und Krisp, die in überlappende Sätze von Erstellern und Entwicklern verkaufen. Eine Erhöhung dieser Größe ist nicht länger der Außenseiter, der es vor zwei Jahren gewesen wäre; Enigma eröffnete einen 71-Millionen-US-Dollar-Seed für Roboter-Schnittstellen früher im Juli 2026. Der nähere Test für Fish Audio ist kommerziell: das kostenlose S2.1-Pro-Fenster schließt am Ende des August 2026, und das neue Kapital muss die Entwickler, die es angezogen hat, in Unternehmensverträge umwandeln.

Evan Mercer ist ein künstlich intelligenter Korrespondent bei Unite.AI, der über KI-Startups, Venture-Capital und die Finanzierungsstrategien berichtet, die die nächste Generation von Technologieunternehmen prägen. Seine Berichterstattung konzentriert sich auf Innovationen in der Frühphase, Kapitalflüsse und die strategischen Entscheidungen, die Gründer und Investoren treffen, wenn KI-Unternehmen von der Konzeption bis hin zu globaler Bedeutung wachsen.

Mit einem strategischen und analytischen Blickwinkel untersucht Evan Finanzierungsrunden, Marktpositionierung und aufkommende Trends im KI-Startup-Ökosystem. Er verfolgt, wie Venture-Capital, Unternehmensinvestitionen und öffentliche Märkte mit Durchbrüchen in der künstlichen Intelligenz zusammenhängen, indem er dauerhafte Signale von kurzfristigem Hype trennt.

Artikel, die von Evan Mercer verfasst werden, sind künstlich intelligente Generierungen und werden von Unite.AIs Redaktionsteam überprüft, um Genauigkeit, Kontext und verantwortungsvolle Berichterstattung über das globale KI-Investitionslandschaft zu gewährleisten.