Модели и платформы ИИ
Fish Audio получил 52 миллиона долларов на семя для превращения открытых голосовых моделей в доход

Компания Fish Audio привлекла 52 миллиона долларов в раунде финансирования, который возглавили Coreline Ventures и Capital Today. Эти средства поступают в компанию Fish Audio, которая в течение последнего года бесплатно распространяла свои модели и брала плату за все, что с ними связано. Fish Audio утверждает, что более 8 миллионов человек используют эти модели через открытые релизы или свою платформу, и что бизнес генерирует 21 миллион долларов годового дохода.
Этот раунд был объявлен 28 июля 2026 года с участием 359 Capital, HF0 founder residency и еще пяти фондов, и был первым сообщением TechCrunch. Генеральный директор и сооснователь Рисса Као заявила, что компания работала достаточно эффективно на открытом исходном коде и подписках создателей, чтобы не нуждаться в外нем капитале, и пошла на привлечение средств для разработки более продвинутых моделей и продвижения на рынок корпоративных счетов. Раунд в размере 52 миллионов долларов, который все еще носит статус семенного финансирования, в компании с восемью цифрами годового дохода, подчеркивает, как быстро голосовые технологии перешли от функции продукта к статье инфраструктуры.
От открытых весов к бесплатному API
Компания начала как побочный проект Шиджиа Ляо, бывшего исследователя Nvidia (NVDA ), который обучил модель речи на одном GPU и опубликовал ее. Этот репозиторий, Fish Speech, теперь имеет более 31 000 звезд и популярность среди независимых разработчиков и игровых студий. Ляо является главным ученым Fish Audio, и за примерно год было выпущено пять моделей: четыре генератора речи и одна система распознавания речи.
Три генератора речи открыты для всех. Fish Audio опубликовала веса S2 9 марта 2026 года, вместе с кодом для тонкой настройки и потоковым движком вывода. S2 – это модель с 4 миллиардами параметров, обученная на более чем 10 миллионах часов аудио на примерно 80 языках, управляемая свободными тегами, такими как [шепот] или [профессиональный тон], вставленными на уровне слов. В компании подсчитали более 15 000 таких контролей.
Самая новая модель, S2.1 Pro, – это та, которую компания не выпускает в открытом доступе, и даже она в настоящее время бесплатна через API: нет жесткого ограничения на количество символов, 83 языка и нет гарантии уровня обслуживания, с бесплатным окном, продленным до 31 августа 2026 года. Платные планы включают обязательства по задержке и времени безотказной работы, и компания просит продукты с годовым доходом более 1 миллиона долларов обсудить возможность построения на бесплатном тарифе до начала работы. Fish Audio объясняет, что это стало возможным благодаря перестроенному стеку вывода, включая свою собственную библиотеку ядер GPU в формате FP8, и сообщает, что время первого аудиовывода на один запрос составляет примерно 70 миллисекунд.
Это коммерческая логика бизнеса. Открытые веса и бесплатная модель на переднем крае покупают распространение среди разработчиков; доход поступает от компаний, которым нужны договорные гарантии задержки. Fish Audio утверждает, что корпоративные клиенты, включая HeyGen, Livekit, Retell, Sanas и OpenArt, уже работают на ее API, и Као описывает спрос, разделяющийся по случаям использования: продукты-аватары хотят реализма, игровые студии хотят выразительных голосов персонажей, а компании, работающие с голосовыми агентами, хотят низкой задержки, которая все еще звучит как человеческий голос. Последний сегмент – это тот, который развивается быстрее, поскольку основные помощники добавляют голосовые интерфейсы – Anthropic ввела свои модели Opus и Sonnet в голосовой режим Claude в июле 2026 года, – и поскольку меньшие студии преследуют ту же нишу, включая Tryll Engine с диалогами игр на устройстве.
Кто написал чеки
Два лидера – это необычная пара для американской компании, разрабатывающей инструменты для разработчиков. Coreline Ventures – это небольшой трансграничный фонд, вышедший из DCM Ventures, который пишет первые чеки в США, Японии и Корее из намеренно компактного портфеля, который уже включает японскую лабораторию генеративного голоса. Capital Today – это китайская франшиза потребительского интернета, основанная Кэти Сю в 2005 году, с JD.com (JD ), Meituan, ByteDance и Moonshot AI среди ее активов и вечным фондом примерно в 2,8 миллиарда долларов. 359 Capital, который отделился от Sapphire Ventures в ноябре 2025 года с примерно 300 миллионами долларов под управлением, инвестирует в потребительские и смежные с потребительскими бизнесы. Потребительские деньги, вother words, поддерживают API для разработчиков, исходя из теории, что библиотека голосов сообщества является устойчивым активом.
Осука Хонда, сооснователь и управляющий партнер Coreline, поставил условие на эту теорию. “Подход, ориентированный на сообщество, может стать устойчивым преимуществом только в том случае, если создатели доверяют платформе”, – сказал он в том же интервью. “Это означает, что согласие, прозрачность и атрибуция должны быть встроены в продукт, а не рассматриваться как после мысли”.
Библиотека сформирована пользователями. Fish Audio просит людей предоставить свои собственные голоса для обучения и платит им, когда голос используется, и публичная библиотека теперь содержит более двух миллионов голосов. Эта модель вызвала жалобы ранее в 2026 году, когда создатели заявили, что голоса были загружены без их согласия, и что удаление происходит медленно. 4 июля 2026 года компания задокументировала специальный процесс разрешения споров о праве собственности на голос, который заменяет общую очередь поддержки: заявители подают заявку со страницы модели, предоставляют государственный идентификатор или корпоративное разрешение и читают проверочное предложение вслух. Као сказала, что удаления теперь завершаются менее чем за три минуты.
Что будет дальше
На дорожной карте компании стоят еще две модели: система понимания аудио, которую компания ожидает в этом году, и модель речи к речи, которая все еще находится в разработке. Обе модели ориентированы на стек голосовых агентов, а не на одностороннюю наррацию. Генерация речи уже является переполненным рынком, с ElevenLabs, Cartesia, Speechify и Krisp, продающими в пересекающиеся наборы создателей и разработчиков. Круг финансирования такого размера больше не является аутсайдером, каким он был два года назад; Enigma открыла 71 миллион долларов на семя для интерфейсов роботов ранее в июле 2026 года. Ближайший тест для Fish Audio – это коммерческий: бесплатное окно S2.1 Pro закрывается в конце августа 2026 года, и новый капитал должен превратить привлеченных разработчиков в корпоративные контракты. Ближайший тест для Fish Audio – это коммерческий: бесплатное окно S2.1 Pro закрывается в конце августа 2026 года, и новый капитал должен превратить привлеченных разработчиков в корпоративные контракты, как это было бы аутсайдером два года назад; Enigma открыла 71 миллион долларов на семя для интерфейсов роботов ранее в июле 2026 года.












