Modelos y plataformas de IA
Fish Audio Recauda $52 Millones en Ronda de Semilla para Convertir Modelos de Voz Abiertos en Ingresos

Fish Audio ha recaudado $52 millones en una ronda de semilla copresidida por Coreline Ventures y Capital Today, dinero que llega a una empresa de texto a voz de Palo Alto que ha pasado el último año regalando sus modelos y cobrando por todo lo que los rodea. Fish Audio dice que más de 8 millones de personas ahora utilizan esos modelos a través de las versiones de pesos abiertos o su plataforma alojada, y que el negocio está funcionando con $21 millones en ingresos recurrentes anuales.
La ronda se dio a conocer el 28 de julio de 2026, con 359 Capital, la residencia de fundadores de HF0 y cinco otros fondos que se unieron, y fue informado por primera vez por TechCrunch. La CEO y cofundadora Rissa Cao dijo que la empresa había estado funcionando de manera lo suficientemente eficiente con la distribución de código abierto y las suscripciones de creadores como para no necesitar capital externo, y salió a buscar fondos para modelos más avanzados y un impulso hacia las cuentas empresariales. Una ronda de $52 millones que aún lleva la etiqueta de semilla, en una empresa con ingresos recurrentes de ocho cifras, marca lo rápido que la voz pasó de ser una característica de producto a un elemento de infraestructura.
De pesos abiertos a una API gratuita
La empresa comenzó como un proyecto lateral de Shijia Liao, un ex investigador de Nvidia (NVDA ) que entrenó un modelo de habla en una sola GPU y lo publicó. Ese repositorio, Fish Speech, ahora lleva más de 31.000 estrellas y una seguidora entre desarrolladores independientes y estudios de juegos. Liao es el científico jefe de Fish Audio, y cinco modelos se han lanzado en aproximadamente un año: cuatro generadores de habla y un sistema de habla a texto.
Tres de los generadores de habla están abiertos. Fish Audio publicó los pesos de S2 el 9 de marzo de 2026, junto con el código de afinamiento y un motor de inferencia de transmisión. S2 es un modelo de 4.000 millones de parámetros entrenado en más de 10 millones de horas de audio en aproximadamente 80 idiomas, guiado por etiquetas de forma libre como [susurro] o [tono de transmisión profesional] insertadas en línea a nivel de palabra. La empresa cuenta con más de 15.000 de esos controles.
El modelo más nuevo, S2.1 Pro, es el que se mantiene alejado del lanzamiento abierto, y incluso ese está disponible de forma gratuita a través de la API: sin límite de caracteres duro, 83 idiomas y sin garantía de nivel de servicio, con la ventana gratuita extendida hasta el 31 de agosto de 2026. Los planes pagos llevan los compromisos de latencia y tiempo de actividad, y la empresa pide a los productos con más de $1 millón en ingresos recurrentes anuales que hablen con ellos antes de construir sobre el nivel gratuito. Fish Audio acredita una pila de inferencia reconstruida, que incluye su propia biblioteca de kernel de GPU de FP8, por hacer que ese regalo sea asequible, y informa de aproximadamente 70 milisegundos hasta el primer audio en una sola solicitud.
Esa es la lógica comercial del negocio. Los pesos abiertos y un modelo de frontera gratuito compran distribución entre desarrolladores; los ingresos provienen de las empresas que necesitan latencia contractual. Fish Audio dice que clientes empresariales que incluyen HeyGen, Livekit, Retell, Sanas y OpenArt ya ejecutan sus API, y Cao describe la demanda dividida por caso de uso: los productos de avatar quieren realismo, los estudios de juegos quieren voces de personajes expresivas, y las empresas de agentes de voz quieren baja latencia que aún suene humana. Ese último segmento es el que se mueve más rápido, ya que los asistentes principales agregan interfaces habladas — Anthropic trajo sus modelos Opus y Sonnet a la modalidad de voz de Claude en julio de 2026 — y mientras que los estudios más pequeños persiguen el mismo nicho, incluyendo Tryll Engine con diálogos de juegos de IA en el dispositivo.
Quién escribió los cheques
Los dos líderes son una pareja inusual para una empresa de herramientas de desarrollo de EE. UU. Coreline Ventures es un fondo transfronterizo pequeño que se separó de DCM Ventures, que escribe cheques iniciales en EE. UU., Japón y Corea desde un portafolio deliberadamente compacto que ya incluye un laboratorio de voz generativa japonés. Capital Today es la franquicia de internet de consumo de China que Kathy Xu fundó en 2005, con JD.com (JD ), Meituan, ByteDance y Moonshot AI entre sus participaciones y un fondo evergreen de aproximadamente $2.800 millones. 359 Capital, que se separó de Sapphire Ventures en noviembre de 2025 con aproximadamente $300 millones bajo gestión, invierte en negocios de consumo y negocios adyacentes al consumo. Dinero de consumo, en otras palabras, respaldando una API de desarrollador, sobre la teoría de que la biblioteca de voz de la comunidad es el activo duradero.
Osuke Honda, cofundador y socio gerente de Coreline, puso una condición a esa teoría. “Un enfoque centrado en la comunidad solo puede convertirse en una ventaja duradera si los creadores confían en la plataforma”, dijo en la misma entrevista. “Eso significa que el consentimiento, la transparencia y la atribución deben estar integrados en el producto en lugar de tratarse como ideas posteriores”.
La biblioteca es de suministro de usuario. Fish Audio pide a las personas que envíen sus propias voces para el entrenamiento y les paga cuando se utiliza una voz, y la biblioteca pública ahora tiene más de dos millones de voces. Ese modelo generó quejas a principios de 2026, cuando los creadores dijeron que las voces se habían subido sin su consentimiento y que las solicitudes de eliminación se movían lentamente. El 4 de julio de 2026, la empresa documentó un proceso de disputa de propiedad de voz dedicado que reemplaza la cola de soporte general: los reclamantes presentan desde la página del modelo, envían identificación gubernamental o autorización corporativa, y leen una oración de verificación en voz alta. Cao dijo que las eliminaciones ahora se completan en menos de tres minutos.
Qué se envía a continuación
Dos modelos más están en la hoja de ruta: un sistema de comprensión de audio que la empresa espera este año, y un modelo de habla a habla que aún está en desarrollo. Ambos apuntan a la pila de agente de voz en lugar de la narración unidireccional. La generación de habla ya es un mercado saturado, con ElevenLabs, Cartesia, Speechify y Krisp vendiendo en conjuntos superpuestos de creadores y desarrolladores. Una recaudación de este tamaño ya no es el outsider que habría sido hace dos años; Enigma abrió una semilla de $71 millones para interfaces de robot a principios de julio de 2026. La prueba más cercana para Fish Audio es comercial: la ventana gratuita de S2.1 Pro se cierra a finales de agosto de 2026, y el nuevo capital tiene que convertir a los desarrolladores que atrajo en contratos empresariales. La prueba más cercana para Fish Audio es comercial: la ventana gratuita de S2.1 Pro se cierra a finales de agosto de 2026, y el nuevo capital tiene que convertir a los desarrolladores que atrajo en contratos empresariales.












