AI 모델 및 플랫폼

Fish Audio, 오픈 음성 모델을 수익으로 전환하기 위해 5,200만 달러의 시드 자금을 확보하다

mm
Unite.AI를 Google의 선호 소스에 추가

Fish Audio는 코어라인 벤처스(Coreline Ventures)와 캐피탈 투데이(Capital Today)가 공동으로 주도하는 5,200만 달러의 시드 라운드를 유치했다. 이 자금은 지난 1년 동안 모델을 무료로 제공하고 주변 서비스에 대한 비용을 청구해 왔던 팔로 알토의 텍스트-to-스피치 회사에 도착했다. Fish Audio는 이미 8백만 명 이상의 사람들이 오픈 웨이트 릴리스 또는 호스팅 플랫폼을 통해 이러한 모델을 사용하고 있으며, 이 비즈니스는 현재 2,100만 달러의 연간 재발성 수익을 창출하고 있다고 밝혔다.

이 라운드는 2026년 7월 28일에 공개되었으며, 359 캐피탈(359 Capital), HF0(HF0) 파운더 레지던시, 그리고 다른 5개의 펀드가 참여했으며, 테크크런치(TechCrunch)에서 처음으로 보고되었다. CEO이자 공동 창립자 리사 카오(Rissa Cao)는 회사가 효율적으로 운영되어 외부 자금이 필요하지 않았지만, 더 고급 모델과 기업 계정으로의 확장에 자금을 조달하기 위해 나섰다고 말했다. 8천만 달러의 재발성 수익을 보유한 회사에서 5,200만 달러의 시드 라운드를 유치한 것은 음성 기술이 제품 기능에서 인프라 라인 아이템으로 빠르게 이동한 것을 보여준다.

오픈 웨이트에서 무료 API로

이 회사는 전 Nvidia (NVDA ) 연구원인 시지아 리아오(Shijia Liao)가 단일 GPU에서 음성 모델을 훈련시키고 공개한 사이드 프로젝트에서 시작되었다. 이 저장소인 Fish Speech는 현재 3만 1천 개 이상의 별과 인디 개발자 및 게임 스튜디오의 팔로워를 보유하고 있다. 리아오는 Fish Audio의 최고 과학자이며, 약 1년 동안 5개의 모델이 출시되었다: 4개의 스피치 생성기와 1개의 스피치-투-텍스트 시스템.

스피치 생성기 3개가 공개되어 있다. Fish Audio는 2026년 3월 9일에 S2의 웨이트와 함께 미세 조정 코드와 스트리밍 추론 엔진을 공개했다. S2는 4천억 개의 파라미터를 보유한 모델로, 8천만 시간 이상의 오디오와 80개 언어 이상을 사용하여 훈련되었으며, [whisper] 또는 [professional broadcast tone]과 같은 자유 형식의 태그를 단어 수준에서 사용한다. 회사는 이러한 컨트롤이 1만 5천 개 이상임을 밝혔다.

가장 최근의 모델인 S2.1 Pro는 현재 무료 API로 제공되고 있다: 하드 캐릭터 캡이 없으며, 83개의 언어를 지원하며, 서비스 수준 보장이 없다. 무료 창은 2026년 8월 31일까지 연장된다. 유료 플랜은 대기 시간과 업타임 커밋먼트를 제공하며, 회사는 1백만 달러 이상의 연간 재발성 수익을 보유한 제품에 대해 무료 티어를 사용하기 전에 먼저 회사를 통해 확인하도록 요청한다. Fish Audio는 재구성된 추론 스택, 자신의 FP8 GPU 커널 라이브러리를 포함하여, 이 무료 제공이 가능하도록 했다고 밝혔다. 또한, 회사는 약 70밀리초의 대기 시간을 보유하고 있다고 밝혔다.

이것이 비즈니스의 상업적 논리이다. 오픈 웨이트와 무료 프론티어 모델은 개발자들 사이에서 배포를 사입하는 데 사용되며, 수익은 계약적 대기 시간이 필요한 회사에서 발생한다. Fish Audio는 이미 HeyGen, Livekit, Retell, Sanas, OpenArt와 같은 기업 고객들이 자신의 API를 사용하고 있으며, 카오는 수요가 사용 사례별로 나뉘어 있다고 설명했다: 아바타 제품은 현실성을 원하며, 게임 스튜디오는 표현력이 풍부한 캐릭터 목소리를 원하며, 음성 에이전트 회사는 낮은 대기 시간을 원한다. 마지막 세그먼트는 가장 빠르게 이동하는 세그먼트로, 메인스트림 어시스턴트가 음성 인터페이스를 추가하고 있으며, 더 작은 스튜디오도 같은 니치를 추구하고 있다.

誰が 체크를 썼나

두 리드는 미국 개발자 툴즈 회사에게는異常的な 조합이다. 코어라인 벤처스는 DCM 벤처스에서 분리된 작은 크로스 보더 펀드로, 미국, 일본, 한국에서 초기 투자를 하는 펀드로, 이미 일본의 생성 음성 연구소가 포함된 컴팩트한 포트폴리오를 보유하고 있다. 캐피탈 투데이는 2005년에 Kathy Xu가 설립한 중국 소비자 인터넷 프랜차이즈로, JD.com (JD ), Meituan, ByteDance, Moonshot AI가 포함된 보유물과 약 2억 8천만 달러의 에버그린 펀드를 보유하고 있다. 359 캐피탈은 2025년 11월에 약 3억 달러의 자금을 보유한 상태에서 사파이어 벤처스에서 분리되었으며, 소비자 및 소비자 인접 비즈니스에 투자한다. 즉, 소비자 자금이 개발자 API를 지원하고 있다. 이는 커뮤니티 음성 라이브러리가 지속 가능한 자산이라는 이론에 기반한다.

오스케 혼다(Osuke Honda), 코어라인의 공동 창립자이자 경영 파트너는, “커뮤니티 중심의 접근 방식은 플랫폼을 신뢰하는 창작자만이 지속 가능한优势이 될 수 있다”고 말했다. “이는 제품에 동의, 투명성, 속성성이 후속으로 처리되는 것이 아니라, 제품에 내장되어야 함을 의미한다.”

라이브러리는 사용자 제공이다. Fish Audio는 사람들에게 자신의 목소리를 훈련에 사용하도록 요청하며, 사용된 목소리에 대해 보상한다. 공개 라이브러리는 현재 2백만 개 이상의 목소리를 보유하고 있다. 이 모델은 2026년 초에 논란을 일으켰으며, 창작자들은 목소리가 동의 없이 업로드되었으며, 삭제가 느리다고 주장했다. 2026년 7월 4일, 회사는 전용 음성 소유권 분쟁 처리 프로세스를 문서화했으며, 일반 지원 큐를 대체한다: 주장자는 모델 페이지에서 제출하며, 정부 ID 또는 기업 승인을 제출하고, 확인 문장을 큰 소리로 읽는다. 카오는 현재 삭제가 3분 이내에 완료된다고 밝혔다.

무엇이 다음에 출하되는가

두 개의 모델이 로드맵에 있다: 음성 이해 시스템과 음성-음성 모델이다. 두 모델 모두 일방향 나레이션 대신 음성 에이전트 스택을 대상으로 한다. 음성 생성은 이미 ElevenLabs, Cartesia, Speechify, Krisp와 같은 회사가 경쟁하는 thị trường이다. 이 크기의 자금 조달은 2년 전과 비교하면 더 이상 이상하지 않다. Enigma는 2026년 7월에 로봇 인터페이스에 7,100만 달러의 시드를 열었다. Fish Audio에게 더 가까운 시험은 상업적인 것이다: 무료 S2.1 Pro 창은 2026년 8월 말에 닫히며, 새로운 자금은 개발자들을 기업 계약으로 전환해야 한다.

에반 머서Unite.AI의 AI 생성 기자로, AI 스타트업, 벤처 캐피탈, 및 자금 동태를 다룬다. 그의 보도는 초기 단계의 혁신, 자본 흐름, 및 AI 기업이 개념에서 글로벌 영향을 미치기까지의 전략적 결정에 초점을 맞춘다.
전략적이고 분석적인 시각으로 에반은 자금 조달, 시장 위치, 및 AI 스타트업 생태계 전반의 새로운 트렌드를 조사한다. 그는 벤처 캐피탈, 기업 투자, 및 공공 시장이 인공지능의 돌파구와 어떻게 교차하는지 추적하며, 지속 가능한 신호와 단기적인 호재를 구분한다.
에반 머서가 작성한 기사들은 AI로 생성되어 Unite.AI의 편집 팀에 의해 검토되어 글로벌 AI 투자 풍경에 대한 정확성, 맥락, 및 책임 있는 보도를 보장한다.