AIモデルとプラットフォーム

Google、API と AI Studio で Gemini 3.8 音声モデルを展開

mm
Unite.AI を Google の優先ソースに追加

Googleは2026年9月23日に、Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTSという2つのテキスト音声変換モデルを発表し、これらを同社史上最も表現力の高い音声生成モデルと位置付けました。両モデルは同日、Gemini API と Google AI Studio で提供が開始されました。

この発表は、Group Product Manager の Leland Rechis と Director of Research Science の Alan Cowen が Gemini Audio Team を代表して執筆し、Gemini 3.8 Flash TTS をゲーム、没入型オーディオブック、ポッドキャスト、インタラクティブメディアにおける深いクリエイティブディレクションとキャラクターデザイン向けに位置付けています。Gemini 3.8 Flash-Lite TTS は大量かつコスト効率の高い利用を想定し、吹き替え、音声コンテンツ作成、音声エージェント向けにトーン、ペース、表現ニュアンスを細かく制御できるよう最適化されています。発表では、これらが以前の Gemini Audio リリースである 3.5 Live Translate、3.5 Transcribe、そして Gemini 3.8 Live and 3.8 Live Extended Thinking に続くものとして提示されています。Gemini 3.8 Audio モデルカードによると、これらのモデルは Gemini 3 Pro を基盤とし、TTS バリアントは最大 8K トークンのテキスト入力を受け取り、最大 64K トークンの音声出力を返します。

音声デザインとレプリケーション

Googleは、Gemini 3.8 Flash TTS が自然言語プロンプトを通じてゼロからカスタム音声を作成でき、役割、アクセント、音声特性を100以上の言語と方言にわたってカスタマイズできると述べました。同社によると、今回のリリースにより、従来の30音声のセットが2,000以上の本番対応音声ライブラリに拡大され、メキシコ・スペイン語、ケベック・フランス語、スコットランド英語などの地域バリエーションも含まれます。ユーザーはカスタム音声を保存・管理して、継続プロジェクト間でパフォーマンスの一貫性を保つことができ、ライブラリ音声の音色、ピッチ、速度、アクセントを調整するボイスリミックス機能が近日中に提供されるとリストされています。

音声レプリケーションは、ユーザー自身の声または使用権のある声の30秒音声サンプルから一貫したボーカルプロファイルを再現します。Googleは、この機能が組み込みの同意検証、SynthID ウォーターマーキング、C2PA 資格情報と共に提供されると述べました。

パフォーマンス指示と報告されたベンチマーク

両モデルはパフォーマンスごとに行単位で指示を行うことが可能で、ユーザーは独自の演出指示を書き込むか、Gemini に自然なスクリプトのヒントから配信を制御させることができます。Googleは、長時間の連続音声生成においても音声品質、ペース、キャラクターティンバーを安定させ、スピーカードリフトを最小限に抑えるとし、ポッドキャストやオーディオブック向けであると述べました。ネイティブの二者音声シーンステージングは、単一スクリプトからの多ターン会話を指示し、二つの声を自然なターンテイクで分離します。スクリプト化された声のバーストやバックスチャネルは、<laughs>、<sigh>、<gasp> といった非言語的合図や、\”mhm\”、\”yeah\” といった相槌を追加します。

評価において、GoogleはGemini 3.8 Flash TTS が Hume AI の Voice Design Benchmark で総合トップ(スコア71.4)を獲得し、アクセントモデリングでも60.8で首位を占めたと報告しました。また、Flash TTS と Flash‑Lite TTS が Hume AI の Overall Quality Index でそれぞれ第1位と第2位を保持し、長尺コンテンツや二者音声脚本制御などのユースケースにおいて Gemini 3.1 Flash TTS に対し大幅な改善を示すと述べました。Voice Arena における盲目ヒューマン・プレファレンス評価では、両モデルが日本語、ブラジルポルトガル語、ベトナム語、標準アラビア語、メキシコ・スペイン語、ヒンディー語を含む言語で競合他社の中でトップの位置を占めたとGoogleは述べました。

安全性、制限事項、利用可能性

同意検証システムの下では、レプリケートされた音声を作成する前に、音声所有者からの口頭同意録音を提供し、参照スピーカーと一致させる必要があります。Gemini Audio モデルが生成するすべての音声クリップには SynthID ウォーターマークが付与され、Google はこれを知覚できず、音声出力に直接埋め込まれるため、AI生成音声が検出可能なままになると説明しています。

モデルカードには、幻覚や時折の遅延・タイムアウト問題など既知の制限が記載されており、知識のカットオフは2025年1月とされています。フロンティア安全性に関して、Google DeepMind は Gemini 3.8 Audio モデルが Gemini 3.7 Flash と比較して有意な新機能や実質的な性能向上を示さないことを評価で確認し、同評価ではフロンティア安全性フレームワーク下のトラッキングまたはクリティカル・ケイパビリティレベルに到達していないと判断しました。その結果、Gemini 3.8 Audio モデルがこれらのレベルに到達する可能性は低いと述べました。

Gemini 3.8 Flash TTS は Gemini Notebook でも、Flash‑Lite TTS は Google Vids でも利用可能で、API を通じたエンタープライズアクセスは Gemini Enterprise にて近日提供予定とされています。Google AI Studio は音声デザイン作業空間のように構築されたオーディオプレイグラウンドを追加し、開発者はゼロから新しいボーカルアイデンティティをプロンプトしたり、音声をレプリケートしたりして、二者音声脚本エディタで行単位の配信指示を行うことができます。発表の脚注では、AI Studio を通じた音声レプリケーションは Illinois、Texas、European Economic Area、United Kingdom、Switzerland、India では利用できないと記載されています。開発者プラットフォームの Agora、LiveKit、Pipecat、Vercel が Gemini API を介してこれらのモデルをサポートし、Google は Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang を新しい TTS モデルを用いたグローバル吹き替え、メディアローカリゼーション、対話型音声エージェントの統合パートナーとして指名しました。

ジョナス・リーブは、Unite.AIでのAI生成アナリストで、認知AI、人工一般知能(AGI)、および機械知能の理論的基礎に焦点を当てています。彼の仕事は、生物系と人工系の両方で、学習、推論、記憶、抽象化がどのようにして現れるかを探求し、現代のAIアーキテクチャと認知科学および心の哲学の長年の疑問との間でつながりを築いています。
概念的かつ反省的なアプローチで、ジョナスは、推論モデル、エージェントシステム、出現性認知、整列理論などのフレームワークを検討し、AGIへの進歩が実際に何を意味するか、そして何を意味しないのかを明確にしようとします。タイムラインやヒープを追うのではなく、第一原理、概念的厳密さ、現在のモデルにおける限界を強調しています。
ジョナス・リーブによって著作された記事は、AIによって生成され、Unite.AIの編集チームによって検証されており、先進的なAI概念についての正確性、明確性、責任ある議論を保証しています。