AI 模型与平台

Google 在 API 和 AI Studio 中推出 Gemini 3.8 语音模型

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Google 于 2026 年 9 月 23 日推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,这两款文本转语音模型被描述为迄今为止最具表现力的音频生成模型。两款模型同日开始在 Gemini API 和 Google AI Studio 中推出。

该公告由集团产品经理 Leland Rechis 和研究科学总监 Alan Cowen 代表 Gemini Audio 团队撰写,定位 Gemini 3.8 Flash TTS 用于游戏、沉浸式有声书、播客和交互式媒体中的深度创意指导和角色设计。Gemini 3.8 Flash‑Lite TTS 则面向大规模、成本高效的使用场景,针对配音、音频内容创作和具备细粒度音调、节奏和表现细微差别控制的语音代理进行优化。公告将这两款模型列为继早期 Gemini Audio 发布的 3.5 Live Translate、3.5 Transcribe 以及 Gemini 3.8 Live and 3.8 Live Extended Thinking 模型之后的最新产品。根据 Gemini 3.8 Audio 模型卡,这些模型基于 Gemini 3 Pro,且 TTS 变体支持最高 8K 令牌的文本输入和最高 64K 令牌的音频输出。

语音设计与复制

Google 表示,Gemini 3.8 Flash TTS 能够通过自然语言提示从零创建定制语音,定制角色、口音和语音特征,支持 100 多种语言和方言。公司称,此次发布将原有的 30 种语音规模化为超过 2,000 种可投入生产的语音库,覆盖广泛语言,包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。用户可以保存并管理自己的定制语音,以在持续的项目中保持性能一致,并且即将推出的语音混音功能可对库中语音的音色、音高、节奏和口音进行调整。

语音复制可通过用户本人或用户拥有使用权的 30 秒音频样本,重新创建一致的声纹。Google 表示,此功能配备了内置的同意验证、SynthID 水印以及 C2PA 凭证。

性能指引与报告基准

两款模型均支持对每段表演进行逐行指引:用户可以自行编写舞台指示,或让 Gemini 根据自然脚本提示来引导朗读。Google 表示,长篇生成能够在数小时的连续音频中保持语音质量、节奏和角色音色的稳定,且说话人漂移极小,适用于播客和有声书。原生的双说话人场景排练可从单一脚本指引多轮对话,同时通过自然的轮流保持两种声音分离。脚本化的声线突发和背道反馈加入了非语言提示,如 <laughs>、<sigh>、<gasp>,以及诸如 “mhm” 和 “yeah” 的插入语。

在评估中,Google 报告称 Gemini 3.8 Flash TTS 在 Hume AI 的语音设计基准中以 71.4 分获得总体第一名,并在口音建模中以 60.8 分领先。公司表示,Flash TTS 与 Flash‑Lite TTS 在 Hume AI 的整体质量指数中分别位列第一和第二,且新模型在包括长篇内容和双说话人剧本控制在内的使用场景上相较 Gemini 3.1 Flash TTS 有显著提升。在 Voice Arena 的盲测人类偏好评估中,Google 称这两款模型在包括日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语等语言的竞争中位居首位。

安全性、局限性与可用性

在同意验证系统下,用户必须提供与参考说话者相匹配的语音所有者的口头同意录音,才能创建复制的语音。Gemini Audio 模型生成的每段音频均带有 SynthID 水印,Google 将其描述为不可感知且直接嵌入音频输出,以确保 AI 生成的语音仍可被检测到。

模型卡列出了已知的局限性,包括幻觉以及偶发的慢速或超时问题,并给出知识截止时间为 2025 年 1 月。针对前沿安全,Google DeepMind 表示其评估未发现 Gemini 3.8 Audio 模型相较 Gemini 3.7 Flash 有任何有意义的新能力或显著的性能提升,其评估发现后者未达到其前沿安全框架下的任何跟踪或关键能力水平。基于此,DeepMind 认为 Gemini 3.8 Audio 模型不太可能达到这些水平。

Gemini 3.8 Flash TTS 也可在 Gemini Notebook 中使用,Flash‑Lite TTS 则在 Google Vids 中提供,企业通过 API 在 Gemini Enterprise 的访问即将推出。Google AI Studio 增加了一个类似语音设计工作区的音频实验场,开发者可以从零提示生成新的声线身份或复制语音,然后在双说话人剧本编辑器中对逐行交付进行指引。公告脚注指出,AI Studio 的语音复制在伊利诺伊州、德克萨斯州、欧洲经济区、英国、瑞士和印度不可用。开发者平台 Agora、LiveKit、Pipecat 和 Vercel 通过 Gemini API 支持这些模型,Google 还列出 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 为合作伙伴,整合新 TTS 模型用于全球配音、媒体本地化和对话式语音代理。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。