AIモデルとプラットフォーム

Google、Gemini 3.8 Live と Extended Thinking 音声モデルを発表

mm
Unite.AI を Google の優先ソースに追加

Google は 2026年9月15日に Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking を発表しました。この 2 つのライブ対話モデルは Gemini API、Google AI Studio、Gemini Enterprise、Search Live、Gemini Live、Google Workspace で展開されています。

このモデルは、プリンシパルエンジニアの Tom Ouyang とテクニカルスタッフのメンバーである Malini Jaganathan が Gemini Audio Team を代表して紹介しました。Google はこの 2 つを、これまでで最も高度なライブ対話モデルであり、自然な会話向けに構築されたものと説明し、知能と並列推論の向上により、音声で実行される複雑なタスクでの協働がより直感的になると述べています。同社は Gemini 3.8 Live をスケールとコスト効率のために位置付け、会話インテリジェンスと流動的な対話、ビジュアルグラウンディングを組み合わせています。一方、Gemini 3.8 Live Extended Thinking は、知能の向上とマルチステップ推論を必要とする高複雑度タスク向けに構築されています。Google によれば、これらのモデルは開発者と企業に信頼性の高い本番環境向け音声エージェントの構築ブロックを提供し、Gemini アプリ、Workspace、Search 全体での Gemini との会話をより流暢にします。

報告されたベンチマーク結果

Google は、Gemini 3.8 Live Extended Thinking が Artificial Analysis の Speech to Speech Quality Index で全体トップの位置を取得し、スコアは 82.6 であること、さらに τ-Voice で 68.6%、Sierra の τ-Voice-banking ベンチマークで 35.1% のエージェントタスク完了率でリードしていると報告しています。同社はまた、Big Bench Audio で 97.7% のスコアを記録し、Extended Thinking が他の最先端モデルに比べて非常に競争力のある価格設定を維持していると述べています。Google は、Gemini 3.8 Live が Artificial Analysis の Speech Agent Arena で2位に入賞し、ユーザーからの高い支持を受けており、コスト効率が高くスケール向けに設計されていると説明しています。ServiceNow の EVA-Bench(音声エージェント評価ベンチマーク)において、Google は自社モデルが複雑なワークフローに対して正確性と会話品質のバランスをうまく取り、パレートフロンティアを押し上げていると述べています;この評価は Gemini Enterprise エージェントプラットフォーム上の Live API で実施されたと記事は指摘しています。

リアルタイム会話機能

Google によれば、Gemini 3.8 Live は視覚入力をほぼリアルタイムで処理し、コンテキストを追加することで、より有用な応答を生成するとしています。このモデルは会話中に自動で 97 のサポート言語を検出・切り替え、会話が続く間にバックグラウンドでツールや API 呼び出しを実行し、リクエストを認識しつつタスクが完了するまで対話を維持します。より深い推論が必要なタスクに対しては、Google は Extended Thinking が同時に推論と発話を行い、初期の口頭キューで自然にプロンプトを認識し、ライブ進行ナレーションでユーザーをマルチステップのバックグラウンドタスクへ案内し、会話の流れを途切れさせないと述べています。

発表と共に公開されたデモ動画では、Gemini 3.8 Live が視覚コンテキストを活用してリアルタイムで従業員オンボーディングセッションを案内し、ライブ質問に答え、ほぼリアルタイムでチェスをプレイし、自然な音声で完全なビジネスプランやカスタムマーケティングツールキットを作成し、Search Live 内でステップバイステップのトラブルシューティング支援を提供する様子が示されています。Extended Thinking のデモでは、モデルが手描きスケッチとほぼリアルタイムの音声フィードバックを機能的な React コンポーネントに変換し、非同期関数呼び出しを通じて会話を中断せずにマルチステップのレストラン予約を調整し、Google Workspace の Docs Live、Gmail Live、Keep Live 全体で動作する様子が示されています。

Live API と開発者エコシステム

Google は、Agora、Fishjam、LiveKit、Pipecat、Vercel、Vision Agents を、Gemini Live API を利用して開発者が音声駆動インターフェースを構築・デプロイできるようにし、プラットフォーム側で基盤となるリアルタイムメディアストリーミングインフラを管理する開発者プラットフォームとして挙げています。同社はまた、Salesforce、Genspark、Lumeris と新モデルで提携しており、これらはモデルのレイテンシ、流動性、ツール呼び出し機能に関心を示していると述べています。

公式の Live API ドキュメントは、インターフェースが Gemini と低遅延・リアルタイムの音声およびビジョンインタラクションを可能にし、音声、画像、テキストの連続ストリームを処理してステートフルな WebSocket 接続上で即時の音声応答を提供すると説明しています。入力として記載されているのは、16kHz の 16 ビット PCM 生音声、1 秒あたり最大 1 フレームの JPEG 画像、テキストで、音声出力は 24kHz の 16 ビット PCM 生音声です。開発者は、バックエンドがクライアントのストリームデータを Live API に転送するサーバー間実装、またはフロントエンドコードが直接 WebSocket で接続するクライアント対サーバー実装を選択できます。ドキュメントは、リテールショッピングアシスタントやサポートエージェント、インタラクティブゲームキャラクター、ロボティクス、スマートグラス、車両における音声・映像対応体験、ヘルスコンパニオン、金融アドバイザリーツール、教育メンター、リアルタイム翻訳、ライブ文字起こし・キャプションなどのユースケースを列挙しています。

Google は、同社の AI 製品が生成するすべての音声に SynthID という不可視の透かしを埋め込み、AI 生成コンテンツが検出可能であるようにして誤情報の防止に役立てていると述べています。この記事は、同社の安全性と責任に関する取り組みの詳細について、モデルカードを参照するよう読者に案内しています。

利用可能性と展開

両モデルは 9 月 15 日にロールアウトを開始しました。開発者向けには Gemini API と Google AI Studio で利用可能で、エンタープライズ向けには Gemini Enterprise のプライベートプレビューで提供されています。Gemini 3.8 Live は Search Live ですべてのユーザーが利用でき、Extended Thinking は Gemini Live、Google AI Pro および Ultra サブスクライバー向けの Workspace の Docs、そしてすべての Google AI サブスクライバー向けの Gmail と Keep で利用可能です。Google は、両モデル向けのカスタマーエクスペリエンスサポートを提供する Gemini Enterprise が近日中にリリースされると発表しており、Extended Thinking も Google Workspace のビジネス顧客向けに近日中に提供される予定です。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。