AI 模型与平台
Google 推出 Gemini 3.8 Live 与扩展思考语音模型

Google 宣布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking于 2026 年 9 月 15 日发布,这是一对在 Gemini API、Google AI Studio、Gemini Enterprise、Search Live、Gemini Live 和 Google Workspace 中推出的实时对话模型。
这些模型由首席工程师 Tom Ouyang 和技术员工 Malini Jaganathan 代表 Gemini Audio 团队介绍。Google 将这对模型描述为迄今为止最先进的实时对话模型,旨在实现自然对话,并表示智能和并行推理的提升使其在通过语音执行的复杂任务中更易于协作。公司将 Gemini 3.8 Live 定位为具备规模化和成本效率的模型,融合对话智能、流畅对话和视觉定位;而 Gemini 3.8 Live Extended Thinking 则面向需要更高智能和多步骤推理的高复杂度任务。根据 Google 的说法,这些模型为开发者和企业提供了构建可靠、可投产的语音代理的基础,同时使在 Gemini 应用、Workspace 和 Search 中的对话更加流畅。
报告的基准测试结果
Google 报告称,Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的语音到语音质量指数中获得了 82.6 的最高总体得分,并在 τ-Voice 上以 68.6% 的完成率以及在 Sierra 的 τ-Voice-banking 基准上以 35.1% 的完成率领先于代理任务。公司还报告在 Big Bench Audio 上取得 97.7% 的得分,并表示 Extended Thinking 相较于其他前沿模型保持了极具竞争力的价格。Google 称 Gemini 3.8 Live 在 Artificial Analysis 的 Speech Agent Arena 中排名第二,指出用户偏好度高,并描述其成本效益高且适合规模化。 在 ServiceNow 的 EVA-Bench(用于评估语音代理的基准)中,Google 表示其模型通过成功平衡准确性与对话质量,推动了复杂工作流的帕累托前沿;文章指出此评估是在 Live API 上使用 Gemini Enterprise 代理平台进行的。
实时对话能力
Google 表示,Gemini 3.8 Live 能够近实时处理视觉输入,添加的上下文能够产生更有帮助的回复。该模型在对话过程中自动检测并在 97 种支持的语言之间切换,并在后台执行工具和 API 调用,同时对话继续进行,能够确认请求并在任务完成时保持对话进行。对于需要更深层推理的任务,Google 称 Extended Thinking 能够同时推理和发声,利用早期的语言提示自然地确认提示,并通过实时进度叙述引导用户逐步完成多步骤后台任务,而不打断对话流。
随公告发布的演示视频展示了 Gemini 3.8 Live 在实时使用视觉上下文回答现场提问的情况下,引导员工入职培训,近实时下棋,通过自然语言生成完整的商业计划和定制营销工具包,并在 Search Live 中提供一步步的故障排除帮助。Extended Thinking 的演示则展示了该模型将原始草图和近实时语音反馈转化为可用的 React 组件,通过异步函数调用协调多步骤的餐厅预订而不打断对话,并在 Google Workspace 中的 Docs Live、Gmail Live 和 Keep Live 中协同工作。
Live API 与开发者生态系统
Google 将 Agora、Fishjam、LiveKit、Pipecat、Vercel 和 Vision Agents 列为使用 Gemini Live API 的开发者平台,这些平台让开发者构建并部署语音驱动的界面,同时管理底层的实时媒体流基础设施。公司还表示正与 Salesforce、Genspark 和 Lumeris 合作这些新模型,强调它们对模型的延迟、流畅性以及工具调用能力的兴趣。
官方 Live API 文档将该接口描述为能够实现与 Gemini 的低延迟、实时语音和视觉交互,处理音频、图像和文本的连续流,并通过有状态的 WebSocket 连接提供即时的语音响应。文档中规定的输入为 16kHz 的 16 位 PCM 原始音频、最高每秒一帧的 JPEG 图像以及文本,音频输出为 24kHz 的 16 位 PCM 原始音频。开发者可以选择服务器到服务器的实现方式,即后端将客户端流数据转发至 Live API,或客户端到服务器的实现方式,即前端代码直接通过 WebSocket 连接。文档列出的使用场景涵盖零售购物助理和客服代理、互动游戏角色、机器人、智能眼镜和车辆中的语音与视频体验、健康伴侣、金融顾问工具、教育导师、实时翻译以及实时转录和字幕。
Google 表示,其所有 AI 产品生成的音频均带有 SynthID 水印,这是一种不可感知的水印,直接嵌入音频输出,使 AI 生成的内容仍可被检测,以帮助防止错误信息。文章引导读者查阅模型卡,以了解公司在安全和责任方面的做法细节。
可用性与推出计划
两款模型于9月15日开始陆续推出。对开发者而言,它们可通过 Gemini API 和 Google AI Studio 使用;对企业用户,则在 Gemini Enterprise 中进行私密预览。Gemini 3.8 Live 在 Search Live 中向所有人开放,而 Extended Thinking 可在 Gemini Live、通过 Workspace 为 Google AI Pro 与 Ultra 订阅者提供的 Docs,以及面向所有 Google AI 订阅者的 Gmail 和 Keep 中使用。Google 表示,面向客户体验的 Gemini Enterprise 将很快支持这两款模型,且 Extended Thinking 也将很快面向 Google Workspace 商业客户推出。












