ChatGPT、Claude 和 Grok 同时宕机:9 月 3 日发生了什么
2026 年 9 月 3 日,恰恰是三个最知名的 AI 服务几乎同时报告了问题:OpenAI 的 ChatGPT、Anthropic 的 Claude 和 SpaceXAI 的 Grok。对用户来说,这看起来像是共同的 ChatGPT-Claude-Grok 宕机 。国际上,该事件相应地经常被“chatgpt claude grok outage”等搜索查询描述。
时间上的重叠已得到证实。然而,单一的共同原因并非如此。OpenAI 提到了自己的路由错误,SpaceXAI 在 Grok 方面提到了其孟菲斯数据中心的故障,而 Anthropic 则表示存在基础设施问题,但没有公开同样的具体触发因素。要理解在这个星期四究竟发生了什么,正是这种区分很重要。
简而言之
- 是的,故障发生了重叠。 Claude 在 UTC 13:26 开始报告问题,Grok 在 UTC 13:30 开始,OpenAI 将其路由错误记录在 UTC 14:43 左右。
- OpenAI 证实了路由错误。 因此,ChatGPT 和 Codex 对部分用户来说跨平台不可用或容易出错。
- Grok 有不同的公开触发因素。 SpaceXAI 将故障归因于孟菲斯计算中心的一起故障。
- Anthropic 证实了基础设施问题。 然而,该公司没有提供 Claude 故障直接由孟菲斯或 Colossus 1 引起的确凿证据。
- 并未证实存在单一的重大故障。 Cloudflare 以及主要云服务提供商的公开状态信息均未显示存在任何单一的全球基础设施故障可以解释所有这三个服务同时发生故障。
ChatGPT-Claude-Grok 宕机:已确认的时间线
状态消息显示了事件在时间上的紧密程度。以下概述使用 UTC,并另外计算为中欧夏令时(CEST,UTC+2)。在 OpenAI 方面,发言人提及的开始和缓解时间与状态页面的条目一致。
| 时间 | 服务 | 已确认事件 |
|---|---|---|
| 12:37 UTC / 14:37 MESZ | Claude | Anthropic 最初单独调查 Claude Sonnet 5 的错误率升高。 |
| 12:56 UTC / 14:56 MESZ | Claude | 单独的 Sonnet-5 事件被标记为已解决。 |
| 13:26 UTC / 15:26 MESZ | Claude | 正在调查多个 Claude 模型的新、更广泛的故障。 |
| 13:30 UTC / 15:30 MESZ | Grok | xAI 报告 Grok Web 发生模型故障,并开始调查。 |
| 14:43 UTC / 16:43 MESZ | ChatGPT | 据 OpenAI 称,一项路由错误开始影响部分用户的 ChatGPT 和 Codex。 |
| 15:17 UTC / 17:17 MESZ | ChatGPT | OpenAI 已部署了补救措施并正在监控恢复情况。 |
| 16:06 UTC / 18:06 MESZ | Claude | Anthropic 报告已部署修复程序并正在监控恢复情况。 |
| 16:16 UTC / 18:16 MESZ | Claude | Anthropic 将影响结束时间定为 UTC 16:16。 |
| 16:55 UTC / 18:55 MESZ | ChatGPT | OpenAI 状态页面将事件标记为已解决。 |
| 17:07 UTC / 19:07 MESZ | Grok | xAI 报告流量恢复正常。官方持续时间为 3 小时 37 分钟。 |
因此,ChatGPT、Claude 和 Grok 的官方报告事件窗口重叠了约 93 分钟,从 UTC 14:43 到 16:16。然而,这并不意味着在此期间所有用户都会同时在所有三个服务上遇到完全的故障。OpenAI 在 UTC 15:17 已经启动了缓解措施,并且状态页面反映的是聚合可用性。
ChatGPT 发生了什么
OpenAI 在其状态页面上将此次事件描述为“ChatGPT 和 Codex 出现错误率升高”。其中涉及 15 个 ChatGPT 组件和 4 个 Codex 组件。OpenAI 在接受媒体采访时解释说,自太平洋时间(即 UTC 14:43)早上 7:43 左右以来,一项 路由错误 导致 ChatGPT 和 Codex 对某些用户跨多个平台不可用。
从 UTC 15:17 左右开始,一项补救措施已生效。OpenAI 随后进入了监控阶段,并稍后将事件标记为已解决。对于单个 Codex 远程控制用户,还存在一个具体的后续影响:他们可能需要在事件后重新配对他们的移动设备。
路由错误不一定意味着实际的 AI 模型发生了故障。简单地说,将传入请求导向正确服务、集群或后端的基础设施可能无法正常工作。但对用户来说,结果是一样的:请求失败、挂起或服务似乎完全离线。
Claude 发生了什么

来源: thesvg.org
9 月 3 日,Anthropic 最初报告了一起短暂的 Sonnet-5 事件,随后又报告了多个 Claude 模型更广泛的故障。
在 Anthropic,情况稍微复杂一些。一起涉及 Claude Sonnet 5 错误率升高的情况最初发生在 UTC 12:37,并在 UTC 12:56 已经解决。仅半小时后,Anthropic 又因 Claude Mythos 5.1、Claude Fable 5.1 和 Claude Opus 5 的错误率升高而开启了新的事件。
之后,Anthropic 发布了一份更广泛的受影响模型列表,包括 Mythos/Fable 5.1、Mythos/Fable 5、Opus 5、Opus 4.8 和 Opus 4.6。UTC 13:41,状态页面报告已确定原因;UTC 16:06,已部署修复程序。根据 Anthropic 的说法,影响在 UTC 16:16 结束。
Anthropic 在接受 The Register 采访时将此事件描述为一项 基础设施问题,该问题暂时影响了 Claude.ai、Claude Code、Claude Cowork 和 Claude API。在此期间,Anthropic 没有发布详细的技术事后分析报告,明确将此次故障归因于特定的外部数据中心或云提供商。
Grok 发生了什么

来源: thesvg.org
官方 Grok 状态页面记录了从 UTC 13:30 到 17:07 的故障,持续时间为 3 小时 37 分钟。
xAI 对 Grok 事件的记录最为清晰:UTC 13:30,开始调查 Grok Web 的“模型故障”。UTC 17:07,状态页面报告流量恢复正常。显示的持续时间正好是三小时三十七分钟。
状态页面本身并未提及根本原因。SpaceXAI 后来公开解释说,Grok 问题是在 孟菲斯计算中心发生故障 后出现的。同时,该公司还向受影响的计算合作伙伴道歉。后一种表述对于解释 Claude 的问题特别重要,因为 Anthropic 自 2026 年 5 月以来确实从 SpaceX 获取了计算能力。
Claude 和 Grok 是否通过 SpaceX 相关联?

来源: models.dev
Anthropic 和 SpaceXAI 于 2026 年 5 月证实了与 Colossus 1 相关的重大计算合作伙伴关系。这使得技术连接看起来是合理的,但并不能证明 9 月 3 日 Claude 故障的原因。
这是故事中最有趣但也最容易被误解的部分。Anthropic 于 2026 年 5 月 6 日正式宣布,将使用 SpaceX 数据中心 Colossus 1 的全部计算能力。据双方公司称,该设施拥有超过 220,000 个 Nvidia GPU;Anthropic 则表示增加了超过 300 兆瓦的容量。
然而,Anthropic 并非只在这一基础设施上运行 Claude。该公司还提到了 AWS Trainium、Google TPU 以及来自其他合作伙伴的 Nvidia GPU。因此,计算协议并不自动意味着每个 Claude 请求都通过 Colossus 1 运行,或者那里的故障必然会影响 Claude。
SpaceXAI 在孟菲斯发生故障后明确向“计算合作伙伴”道歉,而 Anthropic 是一个公开确认的计算合作伙伴,这使得这种关联 看起来是合理的. 。但到目前为止尚未得到证实。Anthropic 本身并未公开将 9 月 3 日的故障归因于 SpaceX、孟菲斯或 Colossus 1。因此,不能将合理的架构连接作为已确认的根本原因陈述。
是 Cloudflare 或大型云平台导致了这次故障吗?
几乎同时发生的问题起初让人联想到一个共同的第三方提供商:Cloudflare、AWS、Google Cloud 或 Microsoft Azure,如果多个大型在线服务同时发生故障,它们都是典型的候选者。然而,对此没有任何可靠的证实。
The Register 报道称,Cloudflare 明确表示当时没有发生重大故障。据报道,AWS、Google Cloud 和 Microsoft Azure 的公开状态页面也没有显示出相应的广泛故障。这并非数学上的证据表明不存在任何共同依赖关系:状态页面可能反应延迟,而且大型提供商共享许多小型网络、DNS、硬件和传输依赖关系。但现有证据支持 不存在 任何单一的全球性云故障能够解释所有这三个 AI 服务。
为什么它看起来仍然像是一次共同的重大故障?
从用户的角度来看,这种看法是可以理解的。如果你打开 ChatGPT,遇到错误,切换到 Claude,在那里也遇到问题,然后再是 Grok 也发生故障,那么你实际上就失去了三个独立的备用选项。此外,最大的 AI 提供商依赖于高度集中的基础设施:少数 GPU 类型、少数超大规模云提供商、大型数据中心、全球网络以及众多共享的互联网构建块。
正是在这里,我们必须区分 相关性和因果性 。相同的时间窗口是寻找共同依赖项的一个强烈信号。但它并不证明所有故障都有相同的技术起源。截至 2026 年 9 月 5 日,公开信息更倾向于至少有两个明显可区分的原因:OpenAI 的路由错误和 SpaceXAI 的孟菲斯故障。在 Anthropic 方面,具体原因仍停留在“基础设施问题”的描述之上,尚未公开。
公司应从这次三重故障中学到什么
对于已将人工智能集成到生产流程中的公司而言,事件本身比哪个聊天机器人当天离线时间最长的问题更重要。它表明,所谓的“多提供商设置”并不自动意味着真正的容错能力。
- 追溯基础设施中的依赖关系: 两个不同的模型提供商可能依赖于相同的计算、网络或云合作伙伴。
- 积极检查备用方案: 第二个提供商仅在健康状况真正健康时才有帮助。盲目切换可能会导致错误成倍增加。
- 限制重试次数: API 应使用超时、指数退避和抖动,而不是在事件期间进入激进的重试循环,产生额外的负载。
- 缓存工作: 提示、草稿和中间结果不应仅存在于一次性的聊天会话中。
- 保留手动应急路径: 关键业务流程不应完全阻塞,仅仅因为无法访问任何前沿模型。
- 尤其要保护代理: 长期运行的自主系统需要检查点、幂等性以及在断开连接后能够干净地恢复。
这一点尤其适用于能够自主长时间工作的持久性人工智能代理。我们关于 Grok Bot 及其始终在线的工作流程 的概述表明,对于此类系统而言,不仅模型质量很重要,而且恢复、权限和受控执行也变得至关重要。
ChatGPT、Claude 和 Grok 再次同时出现故障时该怎么办?
- 查看官方状态页面。 对于 OpenAI,它是 status.openai.com, 对于 Claude status.claude.com 对于 Grok status.x.ai.
- 不要立即更改本地设置。 如果提供商本身确认了事件,重新安装浏览器、更改密码或重置路由器通常没有帮助。
- 干净地捕获 API 工作负载中的错误。 5xx 错误和超时应被记录、限制重试,并在需要时移入队列。
- 单独测试备用提供商。 健康检查应在切换之前确认备用服务确实可访问。
- 将中间状态本地保存。 在尝试进一步操作之前,应在聊天之外保存长输入、分析或生成的结果。
- 仅在状态页面正常时才在本地查找。 只有当没有明显的服务提供商问题时,公司防火墙、DNS、VPN、浏览器扩展或自己的网络才更可能是故障源。
常见问题解答
2026 年 9 月 3 日,ChatGPT、Claude 和 Grok 真的同时宕机了吗?
是的,它们官方报告的事件时间段有所重叠。Claude 在 UTC 时间 13:26 开始报告广泛的故障,Grok 在 13:30 UTC 开始,OpenAI 将其路由错误定在约 14:43 UTC。至少到 16:16 UTC,所有三个事件都仍在其记录的事件窗口内。但这并不意味着每个用户在整个重叠期间都经历了完全的故障。
ChatGPT、Claude 和 Grok 故障的共同原因是什么?
尚未确认共同原因。OpenAI 将原因归咎于路由错误。SpaceXAI 将 Grok 的问题归因于孟菲斯计算中心的故障。Anthropic 提到了基础设施问题,但未明确指明与同一原因相关。
Cloudflare 是否在 9 月 3 日负有责任?
对此没有可靠的证实。Cloudflare 告诉 The Register,其服务运行正常,没有出现重大故障。在 AWS、Google Cloud 和 Microsoft Azure 上,公共状态页面也没有显示任何与之匹配的大规模故障。
SpaceX 的故障是否影响了 Claude?
这有可能,但尚未证实。Anthropic 自 2026 年 5 月起使用了 SpaceXAI 的计算能力,并可以访问 Colossus 1。SpaceXAI 在孟菲斯事件后也向受影响的计算合作伙伴道歉。然而,Anthropic 本身并未公开将 9 月 3 日的 Claude 故障归因于 SpaceX 或 Colossus 1。
Grok 故障持续了多久?
Grok 的官方状态页面显示,2026 年 9 月 3 日的事件持续了三小时 37 分钟。调查始于 UTC 时间 13:30,流量在 17:07 UTC 被报告为健康。
ChatGPT 的路由错误意味着什么?
简而言之,路由决定了分布式平台内的传入请求将被转发到哪里。如果这一层出现故障,请求将无法可靠地到达正确的后端。用户将看到超时、错误或无法访问,尽管人工智能模型本身不一定有问题。
结论
2026 年 9 月 3 日的异常情况并非虚构:ChatGPT、Claude 和 Grok 确实发生了重叠故障。因此,“所有三个同时宕机”的标题基本上正确地描述了用户体验。但它不应导致这样的结论:后台发生了单一的、已确认的重大故障。
OpenAI 将路由错误作为其问题的根源。SpaceXAI 将 Grok 的原因归结为孟菲斯计算中心。Anthropic 确认了基础设施问题,但未公开其具体底层依赖关系。现有的 Anthropic-SpaceX 计算合作伙伴关系使得 Claude 和 Grok 之间的联系在技术上是可能的;但如果没有 Anthropic 的确认,它仍然是一个有根据的假设,而不是一个确定的事实。