資金調達
Modulate、音声AI向けインテリジェンス層構築のために$25Mを調達

Modulateは、ボストン拠点の同社が人工知能における拡大する課題、すなわち機械が人々の発言内容だけでなく、発声の仕方まで理解できるようにすることを活用しようとする中で、$25 millionの新たな資金調達を実施した。
Future Venturesがラウンドを主導し、HyperplaneとLakestarが参加した。この資金調達によりModulateの総資金は$60 millionとなり、AI研究、エンジニアリングチーム、開発者向けツール、パートナーシップ、導入オプションの拡大に使用される。
この投資は、音声がAIエージェント、カスタマーサービスプラットフォーム、ゲーム環境、セキュリティシステムのインターフェースとしてますます重要になっている時期に行われた。Speech-to-Text技術は劇的に向上したものの、Modulateは文字起こしだけでは人間の発話に含まれる多くの情報が失われていると考えている。
同社の技術は、音声の背後にあるオーディオを分析し、感情、トーン、意図、ポーズ、合成音声、会話の振る舞いといったシグナルを検出する。
Speech-to-Textを超えて
現在の音声AIスタックの多くは、比較的単純なアーキテクチャに従っている。音声をテキストに変換し、生成された文字起こしを大規模言語モデル(LLM)に送るという流れだ。
この方式は、単語自体にほとんどの重要情報が含まれている場合にはうまく機能する。しかし、意味が皮肉、苛立ち、ためらい、ストレス、割り込み、トーンの変化などに依存する場合には制約が生じる。
Modulateは、これらのシグナルを文字起こしから後で再構築するのではなく、音声から直接分析すべきという考えに基づき、旗艦プラットフォームVelmaを構築した。
同社はVelmaを、文字起こしを生成しながら同時に話者、感情、会話トピック、感情分析、そして150以上の行動を識別できるオーディオネイティブの会話インテリジェンスシステムと説明している。開発者は自然言語の記述を用いてカスタム行動を定義することも可能だ。
これにより、通話が悪化する前に苛立った顧客を特定することから、金融取引中の疑わしい行動を検出すること、あるいはAI音声エージェントが予期せぬ動作をしているときにそれを識別することまで、さまざまな用途に技術を活用できるようになる。
6月に、ModulateはVelmaをAPIを通じて開発者に直接提供し、従来のエンタープライズ展開を超えてアクセスを拡大した。
ModulateはオーディオAIにアンサンブルアプローチを採用
Velmaの下位アーキテクチャは、Modulateがアンサンブルリスニングモデル(ELM)と呼ぶものだ。
すべてのタスクを1つの巨大モデルで処理するのではなく、ELMは100以上の専門モデルを連携させ、個々のコンポーネントがオーディオストリームの異なる特性を分析する。
これらのモデルは、話者の切り替えやポーズといった基本的な特性に加えて、感情、推測される意図、合成音声のマーカー、混乱、行動パターンといった上位レベルのシグナルも検査できる。オーケストレーション層がそれらの観測結果を統合し、会話全体の解釈を導き出す。
これは、音声に対してますます大規模なマルチモーダル基盤モデルを適用するという、近年一般的になりつつある戦略とは大きく異なる哲学である。
Modulateは、専門化によりアーキテクチャがより透明な出力を提供し、必要な計算量を削減できると主張している。詐欺検出やコンプライアンスといったエンタープライズ向けアプリケーションでは、システムがアラートを出した理由を理解できることが、アラート自体と同等に重要になることがある。
同社によると、このアプローチは、特定の音声解析ワークロードにおいて単一の大規模モデルを使用する場合と比べ、最大で1,000倍の計算効率を実現できる。
音声AIが新たなモニタリング課題を生む
今回の資金調達のタイミングは、エンタープライズAI全体で進行中のより広範な変化も反映している。
AIシステムは、顧客との完全な音声会話を実施できる能力がますます高まっている。つまり、企業は人間の従業員だけでなく、数千、場合によっては数百万に及ぶ会話を行う自律エージェントも含めたインタラクションを監視しなければならなくなった。
音声エージェントは技術的にはスクリプトに従っていても、顧客を繰り返し遮ったり、苛立ちを認識できなかったり、意図を誤解したり、感情的な状況に適切に対応できなかったりすることがある。
Modulateは、これらのエージェントと並んで独立したリスニング層になる機会を見出している。
同社の音声エージェント技術は、割り込みやポーズ、感情、アクセント、テキストだけでは捉えにくいその他の特性といったシグナルを識別するよう設計されており、開発者は会話が進行中でもエージェントの挙動を調整できる。
同じインフラは、人間同士の会話にも適用でき、組織はリアルタイムで詐欺、コンプライアンスリスク、ハラスメント、その他の重要な出来事を特定できる。
ゲームモデレーションから広範な音声インテリジェンスへ
Modulateの現在の野望は、以前のオンラインゲームへの注力から大幅に拡大したものです。
同社の最もよく知られた製品の一つであるToxModは、ゲームやソーシャルプラットフォーム上のリアルタイム音声通信を分析し、嫌がらせ、脅迫、グルーミング、その他の有害な行動を特定するために開発されました。
これは依然として事業の重要な部分です。Modulateは、ToxModが既存の音声インフラストラクチャに直接統合でき、問題のあるやり取りをモデレーションシステムや人間のレビュアーにルーティングできると述べています。
同社はActivision、Riot Games、Rockstar Games、Rec Roomなどの大手ゲーム企業と協力しています。
しかし、マルチプレイヤーゲームにおける有害性を理解するために必要な基盤技術は、文脈が重要な他の環境にも適用可能です。
Modulateは現在、その技術を詐欺防止、コンタクトセンター、AIエージェントの監督、ディープフェイク検出、顧客体験、そして信頼と安全の分野に展開しています。
同社の開発者プラットフォームは、現在、文字起こし、ディープフェイク検出、音声編集、会話インテリジェンス、その他の音声分析機能にわたる複数のモデルファミリーを提供しています。
ディープフェイクは、音声を直接理解すべき別の理由を提供する
合成音声は、その機会において別の重要な要素となりつつあります。
ますます説得力のある音声クローンが利用可能になるにつれ、金融取引や機密情報を扱う組織は、発信者が何を言っているかだけでなく、その声自体が本物かどうかを判断する必要があります。
その結果、Modulateはディープフェイク検出へと事業を拡大し、合成音声分析と音声モデルが提供するより広範な文脈情報を組み合わせています。
同社によれば、同社の技術は現在、月間で1,000万時間以上の音声を分析し、累計で6億時間以上を処理しています。
AI生成音楽検出などの領域への拡大は、基盤となるアンサンブルアーキテクチャがどれほど広範に適用可能かを示しています。たとえば、Modulateの音楽検出システムは、音楽の有無、AI生成ボーカル、AI生成楽器を個別に評価し、これらの信号を統合して解釈可能な結果を導き出します。
音声AIにおける次の課題は、話すことではなく理解することです
$2500万の投資により、Modulateは研究、エンジニアリング、開発者ツール、パートナーシップを拡大するための追加リソースを得ました。より広い視点では、これは音声AIにとって高まる課題を反映しています。自然に話すことは会話の半分に過ぎません。
音声エージェントが顧客サービス、ヘルスケア、金融サービスなどの分野に進出するにつれ、システムは文字起こしではしばしば見落とされがちな信号、例えばフラストレーション、ためらい、強調、トーン、そして潜在的な合成音声を理解する必要があります。
これにより、音声インタラクションの周囲に新たなインテリジェンス層が構築され、システムが詐欺を検出したり、顧客の不満を認識したり、AIエージェントが会話を誤解または誤処理している場合を特定したりできるようになります。
しかし、この技術はプライバシー、精度、バイアスに関する問題も提起します。音声から感情や意図を推測することは、単語を文字起こしするよりも主観的であり、特に異なるアクセント、言語、文化間で顕著です。
AIが人間のように話す能力をますます高める中、次のフロンティアは機械が実際にどれだけ上手く聞くことができるか、そしてその能力がどれだけ責任を持って利用されるかを判断することになるかもしれません。












