AI 模型与平台

Google 为 Gemini 3.8 Live 引入实时头像视觉呈现

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Google 于 2026年9月24日推出 Gemini 3.8 Live with Live Avatar,这项功能为其原生实时对话模型的语音添加了近实时生成的视频,并在 Gemini Enterprise 中在美国和欧盟的端点上正式提供。

该公告由研究科学家张硕尹和软件工程师郑CJ 代表 Gemini 音频团队撰写,将此功能呈现为 Gemini 对话式 AI 的视觉呈现层。Google 表示,其精确的唇形同步、自然的表情以及流畅的轮流发言,使企业能够扩展虚拟服务,例如客户服务和互动演示。

此发布紧随 Google 2026年9月15日发布的Gemini 3.8 Live和Gemini 3.8 Live Extended Thinking,这两款实时对话模型分别面向可扩展、成本高效的对话以及高复杂度推理任务,并已通过 Gemini API、Google AI Studio、Gemini 应用、Google Workspace 和 Search Live 开始推送。

Gemini Enterprise 中的正式可用性

Gemini 3.8 Live with Live Avatar 已于 2026年9月24日在 Gemini Enterprise 中正式可用,Google Cloud 表示该技术首次在 Google Cloud Next 2026 进行预览。根据 Gemini Live 组产品经理 Fabien Blanc-paques 在 Google Cloud 帖子中的说明,此发布通过美国和欧盟端点提供,并包括预置吞吐量、企业合规性以及严格的数据治理。Gemini 3.8 Live Extended Thinking 仍处于私密预览阶段。

企业客户可在 Gemini Enterprise 控制台中试用该模型,依据 Gemini Live API 文档进行集成,并在 Google Cloud 的定价页面查看费用。Google Cloud 建议客户与其销售代表合作,以获取预置吞吐量、定制部署架构以及自定义头像的白名单许可。

实时头像的工作原理

据 Google 称,实时头像能够同时处理视觉和音频输入,并以富有表现力的音频和视频进行近实时响应。该功能还支持异步工具调用,能够在后台启动工具调用并检索数据,而不会中断对话。Google 的一项演示展示了头像在对话持续进行的同时,对酒店客人进行签到检查。

Google 表示,头像会根据跨越 97 种语言的对话自动调整唇形同步和表情,保持视频的清晰度并避免视觉漂移。Google Cloud 的帖子补充说明,系统能够实时理解摄像头画面和屏幕共享的视觉内容,并与音频一起处理,具备在中断后恢复对话上下文和后端事务的能力,自动检测语言并在无需手动切换的情况下切换语言,并可部署在网页、移动端和交互式 kiosk 上。另一项 Google Cloud 演示展示了一名保险理赔接收代理在客户通过摄像头展示损失时填写理赔笔记本,同时由 Google 的 Agent Development Kit 构建的代理团队验证保单、应用接收规则,并在后台组装理赔员文件包。

头像、数字水印与模型卡限制

组织可以从预设头像库中部署头像,或使用高质量参考图像生成自定义头像,Google 表示生成的结果能够保留参考图像的相貌、品牌风格或角色身份。创建自定义头像需要企业白名单许可;Google Cloud 将白名单和验证流程描述为身份保护和防止滥用的保障。每个生成的音频和视频流都会嵌入不可察觉的 SynthID 水印,以保持 AI 生成内容的可检测性。

根据 Gemini 3.8 Audio 模型卡,这些模型基于 Gemini 3 Pro。Gemini 3.8 Live 支持音频、图像、视频和文本,上下文窗口可达 128K 令牌;使用 Live Avatar 时,它输出音频、视频和文本,但受限于 24K 令牌的输出上限。模型卡指出,Live Avatar 变体能够生成与语音同步的自然头部运动的富有表现力的视频,这些视频由配置的图像和音频输入驱动,并且它们只能持续几分钟的连续交互,而非数小时的长时间使用。

模型卡列出了已知的局限性,包括可能出现的幻觉以及偶发的慢速或超时,并将知识截止时间设定为 2025 年 1 月。其前沿安全评估发现相较于 Gemini 3.7 Flash 并无显著的新功能或实质性性能提升,基于此,Google 认为 Gemini 3.8 Audio 模型不太可能在其前沿安全框架下达到任何已跟踪或关键能力水平。

客户部署案例

Google Cloud 列举了多家使用该功能的企业案例。Cox Automotive 为 Autotrader 构建了一款 AI 驱动的购物助理,利用实时屏幕高亮和工具调用,实时引导购车者进行车辆搜索、比较和融资。

“购物者越来越期待用自己的语言描述需求,而不是通过筛选和菜单。Cox Automotive 执行副总裁兼首席产品官 Marianne Johnson 在 Google Cloud 宣布 中表示,Autotrader 的全新对话式 AI 头像通过将自然对话匹配到合适的库存,为车辆发现带来了这种体验。”

Equal AI 首席执行官 Akhilesh Damaraju 表示,公司个人 AI 每天处理超过一百万通实时通话,覆盖九种印度语言,并称 Gemini 3.8 Live 改进了中断处理、多语言对话以及工具调用的可靠性。Bob Van Osten,Salesforce 产品副总裁,表示 Agentforce 与 Gemini 3.8 Live 正在通过 Salesforce AI Research 与 Google 的合作结合实时多模态能力和代理式 AI。Specs 的软件工程师 Eric Walsh 表示,该模型的语音活动检测更新和延迟改进是 SPECS 平台上 AI 助手向前迈出的重要一步。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。