AIモデルとプラットフォーム

xAI、Grok Voice Transcribe 2.0 音声文字起こしモデルをリリース

mm
Unite.AI を Google の優先ソースに追加

xAIは2026年9月18日に、最新の音声文字起こしモデルであるGrok Voice Transcribe 2.0をリリースし、バッチ処理の価格を1時間あたり$0.10に設定しました。また、同モデルはGrok Voice Transcribe 1.0の2倍の精度であると説明しています。

Grok Voice Transcribe 2.0は、Grok Voice のオーディオ基盤モデルをベースに構築されています。xAIによると、Grok Voiceはすでに1日あたり数万件の顧客サポート電話を処理し、何百万時間もの動画ナレーションを文字起こしし、Tesla車両に搭載されたGrokアシスタントを含む物理製品内で音声エージェントを稼働させています。同社は、新モデルが多様な環境で収録されたライブで騒がしい多言語音声を用いてトレーニングされ、ポストトレーニングで精緻化されたと述べ、実世界の設定で利用可能な最も高精度な文字起こしモデルの一つであると評価しています。

精度評価

xAIは、Grok Voice Transcribe 2.0が公開されたArtificial Analysisリーダーボード上の32のストリーミングモデルの中で精度トップであると述べました。公開ベンチマークに加えて、同社は本番トラフィックから抽出した4つの内部評価セット(顧客サポート電話の音声、Grokとの会話、アカウントコードやメールアドレスなどの口頭認証情報、短い多言語音声コマンド)で語彙誤り率(WER)を測定しています。同社は、新モデルがこれら4つのセットすべてでGrok Voice Transcribe 1.0を上回り、特に8 kHzの英語顧客サポート電話で構成されるテレフォニーセットにおいてテストした全モデルの中で最高の性能を示したと報告しています。xAIが公開したチャートでは、同モデルをGemini 3.5 Transcribe、MAI-Transcribe-2、ElevenLabs Scribe v2、Deepgram Nova-3、Whisper Large v3と比較しています。

多言語文字起こしはバージョン1.0に比べて最大の精度向上であるとxAIは述べています。同社によれば、モデルは数十言語を文字起こしでき、言語を自動検出し、録音途中での言語切替にも単一パスで対応します。短いフレーズ、例えば車内コマンドなどでは言語を特定するための文脈が少ないため、19言語にわたる音声アシスタント発話の短フレーズセットにおいて、語彙誤り率は20.6%から6.8%に低下したと報告しています。

機能と API アクセス

Speech-to-Text API を通じて、Grok Voice Transcribe 2.0は録音ファイルや URL のバッチ文字起こしとリアルタイムストリーミングの両方に対応します。ドキュメント化された機能セットには、信頼度スコア付きの単語レベルタイムスタンプ、追加料金なしの話者分離、最大8チャンネルのマルチチャネル文字起こし、リクエストごとに最大100個のドメイン用語のキーワードバイアス、数値・日付・通貨・電話番号・メールアドレスを文字形式で返すテキストフォーマット、フィラーワード除去、音声エージェント向けに発話者のターン終了を検出するスマートターン検出が含まれます。xAIは、既存の Speech-to-Text API 統合はコード変更なしで精度向上の恩恵を受けられると述べています。

公式の音声文字起こしドキュメントでは、12のサポートオーディオ形式、最大ファイルサイズ500 MB、サンプリングレートは8000、16000、22050、24000、44100、48000 Hzと記載されています。言語パラメータを使用すると、英語、スペイン語、フランス語、ドイツ語、ヒンディー語、日本語、韓国語を含む25言語で書式設定が可能です。

バッチリクエストはマルチパートフォームデータを使用し、アップロードされたファイルまたはサーバーがダウンロードして文字起こしを行う URL のいずれかを提供する必要があります。レスポンスは全文の文字起こし、検出された言語(BCP‑47 コード)、音声の秒単位の長さ、開始・終了時刻付きの単語レベルセグメントを返します。ストリーミングの場合、クライアントは生音声をバイナリフレームとして wss://api.x.ai/v1/stt の WebSocket エンドポイントに送信し、音声が処理される間に JSON 形式の文字起こしイベントを受け取ります。オプションで約500ミリ秒ごとに中間結果が出力されます。

Loom の導入、価格設定、廃止予定

xAIは、Atlassianが既存の文字起こしソリューションと比較してGrok Voice Transcribe 2.0を評価し、精度が高いことを確認した上で、同モデルをLoom(同社の画面録画製品)上のすべての動画の文字起こしに使用していると述べました。xAIの発表では、AtlassianのTeamwork CollectionシニアバイスプレジデントであるSanchan Saxenaが、Loomの文字起こしをCursorコーディングツールに流すワークフローについて次のように語っています。「GrokがLoomの音声文字起こしを担い、Cursorがそれをコードに変換することで、コンテキストからコードへのループを閉じています。意味することを記録すれば、作業が完了します。」

価格はGrok Voice Transcribe 1.0と同一で、バッチ文字起こしは音声1時間あたり$0.10、ストリーミングは1時間あたり$0.20で、話者分離、タイムスタンプ、キーワードが含まれます。xAIは、Grok Voice Transcribe 2.0がまもなく Speech-to-Text API のデフォルトモデルとなり、バージョン1.0は数週間以内に廃止されると述べました。移行期間中に旧モデルを使用したい顧客は、リクエストで grok-voice-transcribe-1.0 を固定できます。現在のドキュメントでは、モデルパラメータを省略した場合のデフォルトは grok-voice-transcribe-1.0 と記載されており、REST および WebSocket エンドポイントの両方で grok-voice-transcribe-2.0 を選択可能です。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。