AIモデルとプラットフォーム
Fish Audio、オープンな音声モデルを収益に変えるために5.2億円のシード資金を調達

Fish Audioは、コアライン・ベンチャーズとキャピタル・トゥデイの共同リードによる5,200万ドルのシードラウンドを調達しました。この資金は、パロアルトのテキスト・ツー・スピーチ企業に到着し、同社は過去1年間でモデルを無料で配布し、周辺のすべてのものに対して料金を請求してきました。Fish Audioによると、80万人以上がオープン・ウェイト・リリースまたはホステッド・プラットフォームを介してこれらのモデルを使用しており、同社の収益は2,100万ドルの年間再発生収益で推移しています。
このラウンドは2026年7月28日に開示され、359 Capital、HF0の創設者レジデンシー、そして5つの他のファンドが参加し、TechCrunchによって最初に報告されました。CEO兼共同創設者のリッサ・カオは、同社はオープンソース配布とクリエイターのサブスクリプションで十分に効率的に運営できたため、外部資本は必要なかったが、より高度なモデルと企業アカウントへの参入のために資金調達を行ったと述べました。8桁の収益を持つ企業でシードラウンドが5,200万ドルということは、ボイスが製品機能からインフラの行項目へどれだけ速やかに移行したかを示しています。
オープン・ウェイトから無料APIへ
同社は、元Nvidiaの研究者であるShijia Liaoによって始められたサイド・プロジェクトとして始まりました。Liaoは単一のGPUでスピーチ・モデルをトレーニングし、それを公開しました。そのリポジトリであるFish Speechには現在31,000以上のスターがあり、インディー・デベロッパーとゲーム・スタジオの間でフォロワーを集めています。LiaoはFish Audioのチーフ・サイエンティストであり、約1年で5つのモデルが配信されています。4つのスピーチ・ジェネレーターと1つのスピーチ・ツー・テキスト・システムです。
スピーチ・ジェネレーターのうち3つはオープンに公開されています。Fish Audioは、2026年3月9日にS2のウェイトを公開しました。ファイン・チューニング・コードとストリーミング・インフェレンス・エンジンも公開しました。S2は、約80言語にわたる10万時間以上のオーディオでトレーニングされた40億パラメータのモデルです。ワード・レベルで[whisper]または[professional broadcast tone]のようなフリーフォーム・タグで制御されます。同社はこれらのコントロールを1万5千以上持っています。
最新のモデルであるS2.1 Proは、オープン・リリースから除外されているモデルですが、現在はAPI上で無料で提供されています。ハード・キャラクター・キャップはありません。83言語でサービス・レベル・ガランティーはありません。無料のウィンドウは2026年8月31日まで延長されています。有料プランには待ち時間とアップタイムのコミットメントがあります。同社は、年間再発生収益が100万ドルを超える製品については、無料ティアを構築する前に同社と話し合うように求めています。Fish Audioは、独自のFP8 GPUカーネル・ライブラリを含む再構築されたインフェレンス・スタックに、無料で提供することを可能にしたと主張しています。約70ミリ秒で最初のオーディオに到達するという報告があります。
これがビジネスの商業ロジックです。オープン・ウェイトと無料のフロンティア・モデルは、デベロッパー間で配布を買うものであり、収益は契約待ち時間が必要な企業から生じます。Fish Audioは、HeyGen、Livekit、Retell、Sanas、OpenArtなどの企業顧客がすでに同社のAPIを使用していると述べています。カオは、需要がユース・ケースによって分割されていると説明しています。アバタ製品はリアリズムを望み、ゲームスタジオは表現力のあるキャラクター・ボイスを望み、ボイス・エージェント企業は人間のような音質を維持しながら待ち時間を低くしたいと考えています。後者は、メインストリーム・アシスタントが音声インターフェイスを追加し、小規模なスタジオが同じニッチを追求しているため、最も速いペースで進化しています。例えば、Anthropicは、2026年7月にOpusとSonnetモデルをClaudeの音声モードに導入しました。また、Tryll Engineは、ゲーム向けのオンデバイスAIキャラクターと会話を提供するために、600万ドルのプレシード資金を6百万ドルの企業価値で調達しました。
出資者
2つのリードは、米国のデベロッパー・ツール企業にとって珍しいペアリングです。コアライン・ベンチャーズは、DCMベンチャーズからスピンアウトした小規模なクロスボーダー・ファンドで、米国、日本、韓国で早期出資を行っています。ポートフォリオは故意にコンパクトに保たれており、日本のジェネレーティブ・ボイス研究所を含む既存の投資があります。キャピタル・トゥデイは、2005年にケイシー・シューによって設立された中国の消費者インターネットフランチャイズで、JD.com (JD ) 、メイチュアン、バイトダンス、ムーンショットAIを含む約28億ドルの持続可能ファンドを保有しています。359 Capitalは、2025年11月にサファイア・ベンチャーズから約3億ドルの運用資産でスピンアウトしました。消費者向けビジネスや消費者関連ビジネスに投資しています。つまり、コミュニティ・ボイス・ライブラリが持続可能なアセットであるという理論に基づいて、消費者資本がデベロッパーAPIを後援しているということです。
オサケ・ホンダ、コアラインの共同創設者兼マネージング・パートナーは、同理論に条件を付けた。「コミュニティ・セントリック・アプローチは、クリエイターがプラットフォームを信頼する場合にのみ、持続可能なアドバンテージになることができます」と同インタビューで述べた。「つまり、同意、透明性、帰属は、後付けではなく製品に組み込まれるべきです」。
ライブラリはユーザーによって提供されます。Fish Audioは、トレーニングに使用するために自分の声を提出するように人々に依頼し、声が使用されるたびに報酬を支払います。パブリック・ライブラリには現在200万以上の声が収録されています。このモデルは、2026年初頭に批判を浴びせられたとき、クリエイターが同意なしに声をアップロードし、削除が遅いと主張したときに批判されました。2026年7月4日、同社はボイス・オーナーシップ紛争プロセスを文書化しました。申し立て者はモデルのページから申し立てを提出し、政府IDまたは企業の認可を提出し、検証文を朗読します。カオによると、削除は現在3分以内に完了します。
次に何が到着するか
2つのモデルがロードマップにあります。オーディオ理解システムは今年予定されており、スピーチ・ツー・スピーチ・モデルは開発中です。両方とも、ナレーションではなくボイス・エージェント・スタックを目指しています。スピーチ・ジェネレーションはすでに混雑した市場で、ElevenLabs、Cartesia、Speechify、Krispがクリエイターとデベロッパーに販売しています。2年前のアウトライアーのような大規模な資金調達はもはや珍しくありません。例えば、Enigmaは、2026年7月にロボット・インターフェイス向けに7,100万ドルのシード資金を調達しました。Fish Audioにとって、商業的なテストは近い将来にあります。無料のS2.1 Proウィンドウは2026年8月末に閉じられ、新しい資本は、企業契約に引き寄せたデベロッパーを変換しなければなりません。Enigmaはロボット・インターフェイス向けに7,100万ドルのシード資金を調達しました。Fish Audioにとって、商業的なテストは近い将来にあります。無料のS2.1 Proウィンドウは2026年8月末に閉じられ、新しい資本は、企業契約に引き寄せたデベロッパーを変換しなければなりません。












