AIモデルとプラットフォーム

Google、Live Avatar の視覚的プレゼンスを Gemini 3.8 Live に導入

mm
Unite.AI を Google の優先ソースに追加

Googleは2026年9月24日にGemini 3.8 Live と Live Avatarを発表し、ネイティブのライブ対話モデルの音声にほぼリアルタイムで生成されたビデオを追加する機能で、米国と欧州連合のエンドポイントを備えた Gemini Enterprise で一般提供しました。

この発表は、研究科学者の Shuo-yiin Chang とソフトウェアエンジニアの CJ Zheng が Gemini Audio Team を代表して執筆し、Gemini の対話型 AI の視覚的プレゼンス層としてこの機能を提示しています。Google は、正確なリップシンク、自然な表情、流れるようなターンテイキングにより、企業がカスタマーサービスやインタラクティブなウォークスルーなどのバーチャル提供を拡大できると述べています。

このリリースは、Google の 2026年9月15日の Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking のリリースに続き、スケーラブルでコスト効率の高い会話と高度な推論タスク向けに位置付けられたライブ対話モデルで、Gemini API、Google AI Studio、Gemini アプリ、Google Workspace、Search Live を通じて展開が開始されました。

Gemini Enterprise における一般提供

Gemini 3.8 Live と Live Avatar は2026年9月24日現在、Gemini Enterprise で一般提供されており、Google Cloud はこの技術が Google Cloud Next 2026 で初めてプレビューされたと述べています。リリースは米国および欧州連合のエンドポイントを通じて提供され、プロビジョンドスループット、エンタープライズコンプライアンス、厳格なデータガバナンスが含まれます(Gemini Live のグループプロダクトマネージャー Fabien Blanc‑paques の投稿による)。Gemini 3.8 Live Extended Thinking はプライベートプレビューのままです。

エンタープライズ顧客は Gemini Enterprise コンソールでモデルを試用でき、Gemini Live API ドキュメントを通じて統合し、Google Cloud の料金ページで価格を確認できます。Google Cloud は、プロビジョンドスループット、カスタマイズされたデプロイメントアーキテクチャ、カスタムアバターの許可リスト登録について、営業担当者と協力するよう顧客に伝えています。

Live Avatar の仕組み

Live Avatar は視覚入力と音声入力を同時に処理し、ほぼリアルタイムで表情豊かな音声とビデオで応答すると Google は述べています。この機能は非同期ツール呼び出しもサポートしており、会話を中断せずにバックグラウンドでツール呼び出しを開始しデータを取得できます。ある Google のデモでは、アバターがホテルの宿泊客をチェックインさせながら、対話が中断されない様子が示されました。

Google は、アバターが97言語にわたる会話でリップシンクと表情を調整し、ビデオの忠実度を維持しながら視覚的なドリフトを防ぐと述べています。Google Cloud の投稿では、カメラフィードや画面共有のライブ視覚理解が音声と共に提供され、会話コンテキストとバックエンド取引を保持する中断復元、手動切替なしの自動言語検出と切り替え、Web、モバイル、インタラクティブキオスクへのデプロイが加えられています。別の Google Cloud デモでは、保険請求受付エージェントが顧客がカメラで損傷を示す間に請求ノートブックに情報を入力し、Google の Agent Development Kit で構築されたエージェントチームがポリシーを検証し、受付ルールを適用し、バックグラウンドで調整者パケットを組み立てる様子が示されました。

アバター、透かし、モデルカードの制限

組織は、プリセットアバターのライブラリから選択するか、高品質の参照画像からカスタムアバターを生成して展開できます。Google は、結果が参照画像の類似性、ブランドスタイリング、またはキャラクターのアイデンティティを保持すると述べています。カスタムアバターの作成にはエンタープライズの許可リスト登録が必要で、Google Cloud はこの許可リスト登録と検証プロセスを身元保護と悪用防止のための安全策として説明しています。生成されたすべての音声およびビデオストリームには、人間には知覚できない SynthID の透かしが埋め込まれ、AI生成コンテンツの検出が可能です。

Gemini 3.8 Audio モデルカード によると、これらのモデルは Gemini 3 Pro をベースにしています。Gemini 3.8 Live は音声、画像、ビデオ、テキストを受け入れ、コンテキストウィンドウは最大 128K トークンで、Live Avatar を使用すると音声、ビデオ、テキストを出力し、出力トークンは 24K トークンに制限されます。モデルカードは、Live Avatar バリアントが音声に同期した自然な頭部動作を伴う表情豊かなビデオを生成し、構成された画像と音声入力により駆動され、数分間の継続的な対話を維持し、数時間にわたる長時間ではないと述べています。

モデルカードは、幻覚の可能性や時折の遅延・タイムアウトといった既知の制限を列挙し、知識のカットオフを2025年1月と設定しています。そのフロンティア安全性評価では、Gemini 3.7 Flash と比較して有意な新機能や実質的な性能向上は見られず、これに基づき Google は Gemini 3.8 Audio モデルが Frontier Safety Framework の Tracked または Critical Capability Levels に到達する可能性は低いと見なしています。

顧客導入事例

Google Cloud は、この機能を活用している複数の企業を紹介しました。Cox Automotive は、ライブ画面ハイライトとツール呼び出しを使用して、顧客が車両検索、比較、資金調達をリアルタイムで案内する AI 駆動のショッピングアシスタントを Autotrader 向けに構築しました。

「買い物客は、フィルターやメニューを操作するよりも、自分の言葉で欲しいものを説明できることをますます期待しています。Autotrader の新しい対話型 AI アバターは、自然な会話を適切な在庫とマッチさせることで、車両探索の体験を実現します」と Cox Automotive のエグゼクティブ・バイスプレジデント兼チーフ・プロダクト・オフィサーである Marianne Johnson 氏は、Google Cloud の発表で述べました。

Equal AI の最高経営責任者である Akhilesh Damaraju 氏は、同社のパーソナル AI が 9 つのインド言語で毎日 100 万件以上のライブ通話を処理していると述べ、さらに Gemini 3.8 Live が割り込み処理、多言語会話、ツール呼び出しの信頼性を改善したと語った。Salesforce の Agentforce 製品担当副社長である Bob Van Osten 氏は、Agentforce と Gemini 3.8 Live が Salesforce AI Research と Google の協業により、リアルタイムのマルチモーダル機能とエージェント型 AI を組み合わせて共に提供されるようになると述べた。Specs のソフトウェアエンジニアである Eric Walsh 氏は、同モデルの音声活動検出の更新とレイテンシ改善が SPECS プラットフォーム上の AI アシスタントにとって前進であると指摘した。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。