AI 模型与平台

全球中断影响OpenAI的ChatGPT、API和Codex

mm
将 Unite.AI 添加到您在 Google 上的首选来源

2026年7月25日早晨,OpenAI的核心服务在全球范围内出现故障,公司自己的状态页面确认ChatGPT、开发者API和Codex编码助手的错误率显著增加。来自美国、印度和澳大利亚的用户报告无法加载对话、无法访问保存的聊天记录或运行提示,以及数千个外部应用程序依赖的端点。

在其事件页面上,OpenAI仅表示正在“调查列出的服务”,提到了API、ChatGPT和Codex受到影响。截至大约5:30 a.m. ET,公司尚未确定原因或提供完整恢复的估计时间。其顶级状态指示器在事件期间出现波动,有时显示系统完全运行,即使底层事件仍然打开——这种不匹配通常出现在共享依赖项(而不是单个产品)失败时。

中断的范围

用户端数据表明,这是一次广泛的、几乎同时的故障,而不是区域性故障。停机跟踪器DownDetector记录了从大约5:11 a.m. ET开始的报告激增,主要集中在美国、欧洲、印度、日本和澳大利亚。ChatGPT占据了大部分投诉,其次是OpenAI的移动应用和Codex,这一分布与后端问题位于各个前端上游一致。报告描述了服务故障的熟悉特征:挂起的提示、无法加载的对话和项目、以及丢失的登录会话。

分布比原始报告数量更重要。当一个故障同时出现在Web应用程序、移动客户端和API时,原因通常位于共享层(身份验证、路由或所有产品调用的服务基础设施),而不是任何一个服务。OpenAI尚未说明哪一个,目前尚未发布任何公开更新指向根因。

为什么API中断对业务影响最大

对于OpenAI的业务,消费者聊天机器人失效是可见的症状;API和Codex一起失效才是昂贵的部分。OpenAI是最广泛使用的AI平台之一,现在的大部分使用是程序化的,而不是人工输入到聊天框中。API是大型初创企业和企业构建自身软件、代理和内部工具的产品;Codex位于开发人员的编码工作流中。当这些推理端点停止响应时,故障会向下游传播:调用模型的客户端功能返回错误,依赖于工具的工程工作会在服务恢复之前停滞。对于构建在这些调用的软件的团队来说,OpenAI的中断变成了他们自己的中断,表现为对自己的用户的破损功能和错过的服务级别目标。

这种暴露是行业在少数推理提供商周围整合的沉默成本。数十亿美元正在流入训练和提供这些模型的计算能力,从AMD的50亿美元对Anthropic的投资到为新数据中心安排的电力交易,然而,已经部署的可靠性仍然决定了在任何特定早晨是否可以使用这种能力。客户无法访问的模型在此期间一文不值。

反复出现的不稳定性

中断发生在不均匀的正常运行时间段。OpenAI的状态历史记录了过去几天ChatGPT、API和Codex的多次升级错误事件,其中几次需要缓解措施才能恢复。公司自己的状态仪表板显示,ChatGPT在过去三个月的可用性约为99.7%,低于API报告的约99.9%,这表明消费者界面仍然是三个中最不稳定的。

频率才是企业现在通过这些系统路由生产流量的真正故事。单个中断是噪音;一系列中断开始塑造架构决策,从多提供商的回退到对于无法容忍早晨离线的工作负载的自托管模型。每个事件都是该计算中的另一个数据点。OpenAI最近披露其自身测试模型在安全测试期间泄露到Hugging Face,已经使基础设施和安全团队保持警惕;可见的可用性失误增加了对其运营的审查线。

目前,OpenAI的工程师仍在处理事件,尚未发布原因或恢复时间表。公司是否会发布事件后总结,如在更大故障后所做的,将决定市场将了解多少关于导致端点中断的原因。

Theo Nash 是 Unite.AI 的 AI 生成专家,负责报道 AI 基础设施、计算和支持现代人工智能的硬件系统。他的工作重点是大规模 AI 工作负载背后的技术基础,包括数据中心、加速器、网络和将它们连接起来的软件栈。具有分析和工程驱动的视角,Theo 检视 GPU、定制硅、内存架构和分布式系统的进步如何使新一代 AI 模型成为可能。他特别关注性能权衡、能效、可扩展性和实际约束,这些约束影响了 AI 基础设施的现实世界部署。 Theo Nash 撰写的文章由 Unite.AI 的编辑团队审查,以确保技术准确性、清晰度和对快速演变的 AI 计算领域的负责任报道。