作者:梅雅达编程笔记
关键词:AI宕机、ChatGPT、Claude、Agent、基础设施、服务可用性
2026 年 9 月 3 日晚上,全球无数程序员经历了一个魔幻时刻。
你正用 Cursor 赶代码,Cursor 突然报错。切到 ChatGPT 想查个 bug——页面转圈。打开 Claude——500 错误。你心想算了,Grok 试试——也挂了。
你没网崩,WiFi 满格。是 AI 三巨头,同时躺了。
而且这一躺,就是 3 小时 40 分钟。
先说数据,免得你觉得我在编
这不是一个都市传说,是有据可查的集体翻车。
根据 Downdetector 和各家状态页的数据:
OpenAI(ChatGPT + Codex):1.2 万+故障报告。15 个 ChatGPT 组件 + 4 个 Codex 组件同时标记为降级,覆盖对话、登录、搜索、文件上传、语音模式、图像生成、Deep Research、Agent 等核心功能。Codex 的 VSCode 插件和 CLI 也跟着一起歇菜。
Anthropic(Claude):约 1200 份报告。受影响模型包括 Claude Mythos 5.1、Fable 5.1、Opus 5、Opus 4.8、Opus 4.6。Claude Code 和 Cowork 全部报错。
xAI(Grok):约 1000 份报告。美东 API、美西 API、Web 端、iOS、Android、X 平台上的 Grok,全挂。
还没完。Google Gemini 和微软 Copilot 也收到大量用户投诉(虽然 Google 和微软没正式承认)。AI 编程工具 Cursor 直接在公告里说"因为 Claude、ChatGPT、Grok 同时故障,我们部分服务不可用"。
一个晚上,整个 AI 工具生态,几乎全线瘫痪。
时间线:93 分钟的"至暗时刻"
把三家的时间戳摊开来看:
- Anthropic最先发现问题,北京时间 9 月 4 日 08:26 开始报错,15 分钟后说"定位到原因了"。但直到 11:16 才宣布影响结束。注意——它到现在都没公开说具体原因是什么。
- xAI08:30 开始出问题,一直持续到次日凌晨 00:05,总共宕了 3 小时 35 分钟。后来说是他们孟菲斯计算中心出了故障。
- OpenAI09:43 出现路由错误,ChatGPT 和 Codex 部分用户用不了。10:17 说修好了——结果 14:58 又来了一轮更大规模的故障。这次直到 23:55 才彻底恢复。
三家最严重的时间段重叠了93 分钟——从 21:43 到 23:16。
这意味着什么?如果你在这一个半小时里需要 AI 干活,对不起,三家你一个都打不开。
最讽刺的部分:宕机当天,OpenAI 在发新模型
对,你没看错。
就在全球 AI 服务集体瘫痪的时候,OpenAI 在社交媒体上发布了 GPT-6 Astra 的预热视频,宣称这是"目前全球最智能、且对齐程度最高的模型"。
OpenAI 总裁 Greg Brockman 在发布会上说:“人们未来或许会回头将’这个时间、这个模型’视为 AGI 到来的节点。”
最后他加了一句:“欢迎进入 AGI 时代。”
网友评价:先把机房修好再发新模型吧。
这条评论被顶上了热门。你说冤不冤——花了几亿美元、烧了 10 万块 GPU 训出来的最强模型,发布当天的头条是"ChatGPT 挂了"。
为什么三家能一起挂?
这才是值得深挖的问题。
按理说,三家用的云服务不完全一样——OpenAI 靠微软 Azure,Anthropic 跟 Amazon 有合作,xAI 在孟菲斯自建了计算中心。理论上,基础设施应该是隔离的。
但实际情况是,有分析指出几个可能的共同因素:
Cloudflare 问题。Cloudflare 状态页当天显示两个故障:一个是 R2 自定义域名的 HTTP/3 问题,另一个是 WARP 用户地理位置识别错误。三家都用 Cloudflare 做 CDN,这成了一个潜在的共因。而且 2024 年 11 月就出过类似的事——Cloudflare 一次故障同时搞挂了 xAI 和 ChatGPT。
Azure 嫌疑。有消息称微软 Azure 同期宕机报告飙升。虽然 Cloudflare、AWS、Azure、Google Cloud 四家的状态页都没有记录重大故障,但 OpenAI、Anthropic、xAI 三家都以不同形式依赖 Azure 提供部分服务。
流量转移效应。还有一种更隐蔽的可能:当用户打不开 A 模型时,会涌向 B 模型。如果 B 也同时出问题,就形成了连锁过载。Anthropic 和 xAI 在 2026 年 5 月宣布了计算合作伙伴关系,这让流量转移的可能性更大。
但——三家给出的官方原因完全不同:
- OpenAI 说:路由错误
- xAI 说:孟菲斯数据中心故障
- Anthropic 说:基础设施问题(具体没说)
你品品。三家同时出事,三家都说"不是同一个人干的"。
另外补一个数据:Anthropic 官方统计的 Claude 可用性是99.35%。这个数字看着挺高对吧?换算一下就是——一年大概会挂47 小时。
而且不只是 9 月 3 号。光是 9 月份,Claude 就经历了:
- 9 月 1 日:平台 + Office 365 插件降级
- 9 月 2 日:Sonnet 5 短暂报错
- 9 月 3 日:全家桶集体宕机
- 6 月 22 日还出过一次 90 分钟的全球性宕机
头部 AI 的稳定性,真没有宣传的那么靠谱。
对 Agent 开发者意味着什么
如果你只是偶尔用用 ChatGPT,宕机了等恢复就行。
但如果你在搞 Agent 开发——比如你做了一个智能客服 Agent,底层调的是 Claude API,那 Claude 一挂,你的 Agent 就是个废人。用户发消息过来,Agent 想回复,API 返回 500,用户等了三秒没反应,直接关页面走了。
这不是理论问题。Cursor 就是一个活生生的例子——它自己没挂,但它依赖的底层模型挂了,它也跟着残了。
如果你不想重蹈覆辙,有几个东西值得在设计阶段就想清楚:
熔断机制。当上游 API 连续报错时,快速失败,别傻等。给你的 Agent 一个"Plan B 回复",哪怕是一句"我现在有点忙,稍后回复你",也比让用户对着一个转圈的加载图标干等强。
多模型 fallback。别把鸡蛋放一个篮子里。主模型挂了自动切备用模型,哪怕备用模型笨一点,至少有响应。你现在做 Agent 的时候就应该在代码里写好 fallback 链——主用 GLM-4.7-Flash,挂了切 Qwen,再挂切本地小模型。
本地缓存 + 降级回复。当所有 API 都挂了,你的 Agent 至少还能返回一些预缓存的基础回复,而不是直接变成一块砖。
监控告警。别等用户来告诉你"你的 AI 不好使了"。自己监控 API 的健康状态,出问题了主动通知,比被动挨骂强。
资本市场已经给出了答案
这次宕机在美股市场激起了一个有意思的反应:AI 本地化概念的龙头 Palantir 当天暴涨7.71%,收报 182.53 美元。
市场的逻辑很直白:云端 AI 靠不住,私有化部署才是出路。
Palantir 涨不全是这个原因,但这个信号够明显了——当几家美国 AI 巨头能让全球用户在一个晚上同时断粮,企业对"把核心业务绑在别人 API 上"这件事的焦虑,已经从技术层面上升到了董事会层面。
中国开发者怎么看
说实话,这次事件反而让我觉得——国内的 AI 开发生态,没有我们平时吐槽的那么差。
GLM-4.7-Flash 永久免费,200K 上下文,编程能力不弱;Qwen3.8-Max 刚拿下 CodeArena 全球榜首;DeepSeek 的代码生成能力也早就不用多解释了。
与其把所有业务押在几家美国 API 上,不如从第一天就把国产模型接进你的 fallback 链。不是情怀,是生存策略。
你想想:美国 AI 服务宕机的时候,你的 Agent 如果底层走的是国内模型,这波 3 小时 40 分钟的全球故障对你来说就是无感。
这才是真正的"竞争优势"。
写到最后,我想说的其实很简单。
这次集体宕机最讽刺的地方不是"三家一起挂",而是——OpenAI 在同一天发布了号称"对齐程度最高"的模型,结果连自己的服务器都没对齐到在线状态。
AI 行业卷到今天,大家都在比谁模型更强、参数更大、benchmark 更高。但一个基本的事实是:当你的模型强到能跑遍全世界的工作流,你的基础设施却弱到撑不住一个晚上——这种反差,才是真正的 AI 安全问题。
不是模型不安全,是服务不安全。
对做 Agent 的人来说,最该记住的就一句话:别信任何 99.9% 的可用性承诺,自己的 fallback 链才是最后的安全网。