Моделі та платформи ШІ

Fish Audio отримує 52 млн доларів США на розвиток відкритих голосових моделей у напрямку отримання доходу

mm
Додайте Unite.AI до бажаних джерел у Google

Компанія Fish Audio отримала 52 млн доларів США у рамках раунду фінансування, який очолили компанії Coreline Ventures та Capital Today. Ці гроші надійшли до компанії, яка протягом останнього року безоплатно надавала свої моделі та брала оплату лише за додаткові послуги. За словами компанії, понад 8 млн осіб зараз використовують ці моделі через відкриті релізи або хостинг-платформу, а бізнес компанії працює з річним доходом у розмірі 21 млн доларів США.

Раунд фінансування був оголошений 28 липня 2026 року, до нього також приєдналися компанії 359 Capital, HF0, а також ще п’ять інших фондів. Про це вперше повідомив TechCrunch. Генеральний директор і співзасновник компанії Рісса Као заявила, що компанія достатньо ефективно працювала на основі відкритої джерельної бази та підписок творців, тому не потребувала зовнішнього капіталу. Однак компанія вирішила залучити зовнішній капітал для розвитку більш просунутих моделей та входу на ринок корпоративних клієнтів. Раунд фінансування у розмірі 52 млн доларів США, який все ще позначається як початковий, вказує на те, як швидко технологія голосу перейшла від функції продукту до позиції інфраструктури.

Від відкритих ваг до безкоштовного API

Компанія розпочала свою діяльність як побічний проєкт Шіджіа Ляо, колишнього дослідника компанії Nvidia (NVDA ), який тренував модель мови на одному GPU та опублікував її. Цей репозиторій, Fish Speech, зараз має понад 31 тис. зірок та популярність серед незалежних розробників та ігрових студій. Ляо є головним науковим співробітником компанії Fish Audio, а за останні рік компанія випустила п’ять моделей: чотири генератори мови та одну систему розпізнавання мови.

Три з цих генераторів мови відкриті. Компанія Fish Audio опублікувала ваги моделі S2 9 березня 2026 року, разом з кодом для тонкої настройки та потоковим інферентним двигуном. S2 – це модель з 4 млрд параметрів, тренована на понад 10 млн годин аудіо у понад 80 мовах, керується вільними тегами, такими як [шепіт] або [професійний тон], які вводяться на рівні слів. Компанія нараховує понад 15 тис. таких контролів.

Найновіша модель, S2.1 Pro, є тією, яку компанія утримує від відкритої публікації, але навіть вона тимчасово безкоштовна через API: немає жорсткого ліміту символів, 83 мови та жодних гарантій рівня обслуговування, а безкоштовне вікно продовжено до 31 серпня 2026 року. Платні плани передбачають зобов’язання щодо затримки та часу безперебійного доступу, а компанія просить продукти з річним доходом понад 1 млн доларів США звернутися до неї перед побудовою на безкоштовному рівні. Компанія Fish Audio вважає, що оновлений стек інференції, до якого входить власна бібліотека ядра GPU у форматі FP8, робить цю безкоштовну пропозицію доступною, а також повідомляє про приблизно 70 мілісекунд до першого аудіо на одному запиті.

Це є комерційна логіка бізнесу. Відкриті ваги та безкоштовна модель на передньому краї купують розповсюдження серед розробників; доходи походять від компаній, яким потрібні договори про рівень затримки. Компанія Fish Audio заявляє, що корпоративні клієнти, серед яких HeyGen, Livekit, Retell, Sanas та OpenArt, вже використовують її API, а Као описує попит, розділений за випадками використання: продукти аватарів хочуть реалізму, ігрові студії хочуть виразних голосів персонажів, а компанії з голосовими агентами хочуть низької затримки, яка все одно звучить як людина. Останній сегмент розвивається найшвидше, оскільки основні помічники додають голосові інтерфейси — Anthropic ввела свої моделі Opus і Sonnet у голосовий режим Claude у липні 2026 року — а менші студії переслідують ту саму нішу, включаючи Tryll Engine з діалогами для ігор на пристрої.

Хто написав чеки

Два лідери цього раунду фінансування складають незвичайну пару для компанії-розробника з США. Coreline Ventures – це малий транснаціональний фонд, виділений з DCM Ventures, який пише перші чеки у США, Японії та Кореї з компактного портфеля, який вже включає японську лабораторію генеративного голосу. Capital Today – це китайська франшиза споживчого інтернету, заснована Кеті Сю у 2005 році, до якої входять JD.com (JD ), Meituan, ByteDance та Moonshot AI, а також довічний фонд у розмірі близько 2,8 млрд доларів США. 359 Capital, який відокремився від Sapphire Ventures у листопаді 2025 року з близько 300 млн доларів США під управлінням, інвестує у споживчі та суміжні з ними бізнеси. Інвестиції споживчого сектора, тобто, підтримка розробника API, ґрунтуються на теорії, що спільна бібліотека голосів є тривалим активом.

Осука Хонда, співзасновник та керуючий партнер Coreline, поставив умову для цієї теорії. “Підхід, орієнтований на спільноту, може стати тривалим конкурентним перевагою лише у разі, якщо творці довіряють платформі”, – сказав він у тому ж інтерв’ю. “Це означає, що згоду, прозорість та атрибуцію потрібно закладати у продукт, а не розглядати їх як післяthoughts.”

Бібліотека створена користувачами. Компанія Fish Audio просить людей надсилати свої власні голоси для навчання та платить їм, коли голос використовується, а публічна бібліотека зараз нараховує понад два млн голосів. Ця модель раніше зазнала критики, коли творці заявили, що їхні голоси були завантажені без їхньої згоди, а процес видалення тривав повільно. 4 липня 2026 року компанія опублікувала процес вирішення спорів щодо власності голосу, який замінив загальний підтримку: заявники подають заяву з сторінки моделі, надсилають урядові ідентифікатори або корпоративну авторизацію, а потім читають верифікаційний речення вголос. Као заявила, що видалення тепер відбувається менш ніж за три хвилини.

Що буде далі

На дорозі знаходяться ще дві моделі: система аудіорозуміння, яку компанія очікує цього року, та модель мови до мови, яка все ще перебуває у стадії розробки. Обидві ці моделі орієнтовані на стек голосових агентів, а не на односторонню розповідь. Ринок генерації мови вже досить насичений, з компаніями ElevenLabs, Cartesia, Speechify та Krisp, які продають свої продукти перекривним наборам творців та розробників. Інвестиційний раунд цього розміру вже не є таким аутсайдером, яким би він був два роки тому; Enigma відкрила 71 млн доларів США для інтерфейсів робототехніки раніше в липні 2026 року. Ближчий тест для Fish Audio – це комерційний: безкоштовне вікно S2.1 Pro закриється в кінці серпня 2026 року, а новий капітал повинен перетворити розробників, яких компанія привернула, на корпоративні контракти.

Еван Мерсер - кореспондент, створений штучним інтелектом, у Unite.AI, який висвітлює стартапи штучного інтелекту,风险 капітал та динаміку фінансування, що формують наступне покоління технологічних компаній. Його репортажі зосереджені на інноваціях на ранній стадії, потоках капіталу та стратегічних рішеннях, які приймають засновники та інвестори, коли компанії штучного інтелекту розширюються від концепції до глобального впливу.
З стратегічним та аналітичним підходом Еван вивчає раунди фінансування, позиціонування на ринку та нові тенденції в екосистемі стартапів штучного інтелекту. Він відстежує, як风险 капітал, корпоративні інвестиції та публічні ринки перетинаються з проривами в галузі штучного інтелекту, розрізняючи довгострокові сигнали від короткострокової гіпері.
Статті, написані Еваном Мерсером, створені штучним інтелектом і відредаговані редакційною командою Unite.AI для забезпечення точності, контексту та відповідальної висвітлення глобального ландшафту інвестицій у штучний інтелект