AI 模型与平台

OpenAI 的 GPT-Live-1 以每分钟 $0.05 的价格登陆 API

mm
将 Unite.AI 添加到您在 Google 上的首选来源

OpenAI 在 2026 年 9 月 10 日 在 API 中推出了 GPT-Live-1,以每分钟 $0.05 的价格向开发者提供其全双工语音模型,用于前端语音层。此发布将支撑 ChatGPT Voice 的对话系统扩展至第三方应用和业务工作流。

GPT-Live-1 能够同时聆听和发声,OpenAI 表示它将更深层的推理和操作委派给所配对的模型和工具,正如在 Codex 和 ChatGPT Work 中的演示所示。针对 API 的发布,公司称其重点在于提供让开发者能够围绕用户、工作流和目标引导并定制语音体验的功能。

单一模型实现聆听与发声

传统语音代理会将语音转文本、推理模型和文本转语音串联起来,每一次交接都会增加延迟,并带来丢失时序、上下文或对话自然节奏的风险。GPT-Live-1 在单一模型中同时处理聆听和发声,对进出音频进行统一推理,能够在中断和确认发生时即时响应,同时将更深层的推理委派给后端,使对话在后台工作进行时仍可持续进行。

开发者可以自行选择对话背后的模型、工具和代理框架。OpenAI 举例说明,将 GPT-Live-1 与 Luna 等模型配对用于高频任务,如排程或订单更新;而像 Astra 这样的模型则用于需要推理的复杂客户问题;后端也可以使用第三方模型。开发者可通过系统提示来塑造代理的语调、节奏和对话风格。

OpenAI 为 API 版列出了更多优势: 静默的上下文管理和背景噪音处理,无需口头叙述每一步;在长时会话中保持上下文;以及对全双工电话代理的电话支持,可用于餐厅预订到客户支持等通话。GPT-Live-1 原生提供 ASR 转录和响应文本,支持关键词偏置和字母数字理解,尽管它不是基于回合的模型,但原生支持回合检测,使开发者能够围绕明确的回合边界继续构建。公告中发布的代码片段展示了一个应用在会话期间将对话上下文传递给 Codex,并将 Codex 的答案返回给 GPT-Live-1。

报告的评估结果

OpenAI 报告称,GPT-Live-1 在 Full Duplex Bench 基准上比 GPT-Realtime-2.1 提升了 30 个百分点,在回合切换延迟和交互行为方面有显著提升,并且在与 GPT-6 Astra 中等推理力度配合时,在衡量端到端任务的前沿语音代理智能的 Tau3 基准上排名第一。

在 Tau3(语音)智能基准中,该基准评估航空、零售和电信领域的口语客服任务,OpenAI 报告的 Pass@1 任务成功率为 GPT-Live-1 的 86.2%,而 GPT-Realtime-2.1 为 45.7%,GPT-Realtime-2 为 42.4%。在 Tau Banking(语音)知识基准中,以 97 项银行知识任务的成功完成比例计量,报告的数值分别为 32.0% 对比 12.4% 和 10.3%。

公司还报告称,在涵盖停顿处理、对话回合、打断和回声等方面的评估中,GPT-Live-1 的人工分析对话动态平均得分为 97.3%,而 GPT-Realtime-2.1 为 95.7%,GPT-Realtime-2 为 95.3%。在 Full Duplex Bench v1.5 交互性测试中,该测试评估对背景语音、对他人讲话、听者回声以及打断的响应,报告得分为 80.10% 对比 45.4% 和 47.8%。报告的 Full Duplex Bench v1 回合切换延迟(衡量用户结束一次发言后代理开始回复的速度)为 0.798 秒,对比 1.41 秒和 1.63 秒。在使用 Terra 后端、低推理力度运行的 Full Duplex Bench v3 中,OpenAI 报告工具调用 Pass@1 为 87.0% 对比 60.0% 和 58.0%,响应质量为 90.0% 对比 88.0% 和 81.0%。

从 ChatGPT Voice 到 API

OpenAI 于 2026 年 7 月 8 日 推出了 GPT-Live,作为新一代全双工语音模型,为 ChatGPT Voice 提供动力,并在当天向全球 ChatGPT 用户发布了 GPT-Live-1 和 GPT-Live-1 mini,并表示计划将这些模型引入 API。OpenAI 称 GPT-Live-1 将成为 Go、Plus 和 Pro 用户使用 ChatGPT Voice 的默认模型,GPT-Live-1 mini 则是免费用户的默认模型。2026 年 7 月 31 日的更新为通过 ChatGPT Voice 和 OpenAI API 生成的受支持音频加入了 SynthID 水印,并提供了对 OpenAI 公共验证工具的 API 访问。

公告还将企业指向 OpenAI Presence,OpenAI 表示该产品使用 GPT-Live-1 为能够回答问题、解决问题、使用公司系统、执行批准操作并在需要时升级至人工的代理提供实时语音交互。OpenAI 于 2026 年 7 月 22 日推出了 Presence,作为面向语音和聊天工作流的企业级部署产品,通过由 OpenAI 前线部署工程师和精选全球系统集成商主导的有限通用可用性计划向符合条件的客户提供,而非自助式产品。

早期客户与新语音

Yelp 首席技术官 Alex Levy 表示,将 GPT-Live-1 添加到 Yelp Host 和 Hatch 后,提升了回合交互和准确性,优于公司传统的语音架构,并且在 Yelp Host 接听预订和点餐等电话时,Yelp 观察到通话处理率有显著提升。Levy 说:“来电者的说话更完整、更自然,这让我们感受到电话另一端的体验确实不同。”公告中发布的演示展示了 Yelp Host 在 GPT-Live-1 处理背景噪音、旁聊和打断的同时成功预订。

Speak 联合创始人兼首席技术官 Andrew Hsu 表示,早期评估发现,与 Speak 的 Live Tutor Lessons 中的传统回合制系统相比,GPT-Live-1 将学习者思考停顿期间的打断减少了近 80%。Fin 首席运营官 Jordan Neil 说,该模型将 AI 语音支持从停停走走的节奏转向电话通话的自然流动,使客户能够暂停、打断和改变方向,同时 Fin 将对话与其专有支持系统结合以解决问题。Cognition 联合创始人兼首席产品官 Walden Yan 描述了在与 Cognition 的 AI 工程师 Devin 搭配使用 GPT-Live-1 时,能够在键盘之外讨论创意、进行方案压力测试或交接工作。

OpenAI 表示,正从少量实时语音扩展到涵盖更多口音、方言和语言的广泛选择,为开发者提供更多定制助手音色的可能。希望获取自定义语音的开发者必须联系 OpenAI 销售部门了解资格和申请流程。公司称将在未来几个月持续扩展语音选项和语言可用性。

Jonas Reeve 是 Unite.AI 的 AI 生成分析师,专注于认知 AI、人工通用智能(AGI)和机器智能的理论基础。他的工作探索了学习、推理、记忆和抽象如何在生物和人工系统中出现,建立了现代 AI 架构和认知科学、心灵哲学长期存在的问题之间的联系。
以概念和反思的方法,Jonas 检视了推理模型、代理系统、涌现认知和对齐理论等框架,旨在阐明 AGI 进展的真正含义——以及它的不意味着什么。与其追逐时间表或炒作,他强调了第一原则、概念严谨性和当前模型的局限性。
Jonas Reeve 撰写的文章由 AI 生成并由 Unite.AI 的编辑团队审查,以确保高级 AI 概念的准确性、清晰性和负责讨论。