AIモデルとプラットフォーム
Microsoft、MAI-Transcribe-2-Streaming と 2 つの MAI-Voice モデルを発表

Microsoft AI は 2026年10月1日、MAI-Transcribe-2-Streaming を発表し、これは同社初のストリーミング文字起こしモデルであり、MAI-Voice-2.1 と MAI-Voice-2.1-Flash という 2 つの新しいテキスト音声変換モデルと共に、3 つすべてが Microsoft Foundry を通じて利用可能です。
MAI-Transcribe-2-Streaming と Artificial Analysis ベンチマーク
Microsoft は MAI-Transcribe-2-Streaming を、60 言語で自動かつ継続的な言語検出を行い、低遅延でリアルタイムの文字起こしを提供すると説明しています。同社によると、このモデルは Artificial Analysis において最終文字起こしと部分文字起こしの両方で精度 1 位を獲得しており、ベンチマークの精度対遅延評価におけるパレートフロンティア上に位置しているため、精度を向上させても遅延の大幅な犠牲を伴わないことを示しています。投稿内のリーダーボードチャート(2026年9月28日付の Artificial Analysis ストリーミングリーダーボードを引用)では、最終語誤り率が 2.5%、最初の部分語誤り率が 2.8%、最終文字起こしまでの時間が 0.13 秒であることが示されています。
話者が話し終えるのを待つのではなく、モデルは音声を受信してから約 100 ミリ秒で最初の仮説(パーシャル)を生成し、さらに文脈が増えるにつれてそれらを修正し、安定した文字起こしを確定させます。Microsoft は、これにより音声対応アプリケーションは話者が話し終える前に音声を処理でき、音声エージェントは文の途中で推論やツール呼び出しを開始でき、ライブ文字起こしは話し手が話している間にリアルタイムで表示されると述べています。リアルタイムのディクテーションや字幕付けに関しては、同社の内部評価で、最も近い競合製品に比べて文字起こしの単語表示速度が 2 倍速いことが示されています。
Artificial Analysis は述べていますその AA-WER Streaming 指標は、音声がリアルタイムでチャンクごとにストリーミングされるモデルの文字起こし精度を測定し、約 8 時間にわたる 3 つのデータセット(AA-AgentTalk が 50%、VoxPopuli が 25%、Earnings22 が 25%)からの音声を対象としています。これらのデータセットは、多様なアクセント、ドメイン固有の言語、困難な音響条件を含む実世界の音声をカバーしており、ベンチマークの「Time to Final」および「Time to First Partial」測定は、いずれも SileroVAD 音声活動検出器が音声の終了を検出した時点から開始されます。
MAI-Transcribe-2-Streaming は、年末までの期間限定で、音声 1 時間あたり $0.54 の導入価格で提供されます。このモデルは、Microsoft の MAI オーディオ製品ラインを拡張したもので、既に MAI-Transcribe-2(同社が世界最速・最高精度・最安価と称した、ストリーミング非対応の音声認識モデル)を含んでいます。
MAI-Voice-2.1 と MAI-Voice-2.1-Flash
MAI-Voice-2.1 は 23 言語と 26 ロケールに対応しており、Microsoft は単一の音声がすべての言語でネイティブなアクセントを保ち、言語切替時にも同一の話者アイデンティティを維持できると述べています。同社の例では、チュータリングアプリがレッスン途中で教師を変えることなく言語を切り替えることができ、多言語アシスタントは話しかけられた言語で応答しつつ、同じ声として聞こえるようになっています。このモデルの価格は 1M 文字あたり $22 です。
MAI-Voice-2.1-Flash は同じ言語とクロスランゲージスピーカーに対応していますが、高ボリュームかつ低遅延が求められるワークロード向けに設計されています。最大 45 秒の音声を生成でき、エンドツーエンドの遅延は 150 ミリ秒です。Microsoft は、モデル推論が 55%高速化され、同等のモデルに比べて約 60%低コストであると述べています。このモデルの価格は 1M 文字あたり $15 です。
両音声モデルは、数秒の参照音声を使用して、サポート対象のすべての言語で音声クローンを作成でき、Microsoft が濫用防止のための同意ガードレールを組み込んでいると述べています。4,000 人のリスナーを対象としたチューリングテストで、2 つの新音声モデルを組み合わせた結果、リスナーの 50.3%が MAI-Voice を人間の録音と同等、あるいはそれ以上に人間らしいと評価したと同社は報告しています。
Microsoft は、MAI-Transcribe-2-Streaming と MAI-Voice-2.1-Flash の組み合わせを、音声エージェントループ(聞く、理解する、判断する、話すという一連のプロセス)において、双方の端で時間を取り戻す手段として位置付けました。このループは、人間が会話として体験できる時間枠内で完結します。開発者向けのユースケースとしては、話されたリクエストをリアルタイムで文字起こしし、自然な音声で応答するカスタマーサービスエージェント、話された言語を検出し、23 のサポート言語のいずれかで応答できる多言語アシスタント、チュータリング、ロールプレイ、シミュレーション、ナレーション、対話型コンテンツなど、異なる話者を使用したインタラクティブな学習・メディアアプリケーションが挙げられます。
利用可能性と Chatter デモ
MAI-Voice-2.1 と MAI-Voice-2.1-Flash は OpenRouter を通じて利用可能です。3 つのモデルすべては Microsoft Foundry、MAI Playground、Vercel、Azure Voice Live で利用でき、LiveKit は近日公開予定とされています。
モデルがライブエージェントで連携して動作する様子を示すため、Microsoft は MAI Playground に新しいデモ「Chatter」を構築しました。これにより、ユーザーは文字起こしと音声モデルで駆動された音声アシスタントと対話できます。












