AREX Feed Article
SpaceXAI 就 Grok 宕机道歉:孟菲斯算力中心故障所致,系统已恢复
美东时间 9 月 3 日,ChatGPT、Claude、Grok 与 Cursor 四款 AI 服务在同一天先后确认宕机。 报道称,ChatGPT、Claude 与 Grok 都已在各自的状态页确认故障,Cursor 也确认宕机,并把原因指向 Grok 与 Claude 的中断; 形容这是一场影响数千用户、横跨多家平台的大范围中断。当天下午 3:38(北京时间 9 月 4 日凌晨 3:38), 在 :Grok 的问题源于「今晨孟菲斯算力中心的一次宕机(an outage at our Memphis compute center this morning)」,除向用户致歉外,公司还向「受到影响的算力合作伙伴」(impacted compute partners)致歉,并宣布「所有系统现已恢复并正常运行」。
按 PCMag 引述的 Downdetector 数据,当天用户报告的峰值超过 36,000 条。当天下午,ChatGPT、Claude 与 Grok 陆续恢复正常,9to5Google 在太平洋时间 12:38 的更新中把三家服务全部标记为恢复正常。下文未特别注明的均为美东时间。
四家确认宕机,报告从上午 8:30 逐家攀升
9to5Google 当天上午确认,OpenAI 的 ChatGPT、Anthropic 的 Claude 与 Grok 都在各自的状态页上确认了故障。这家媒体写道,AI 服务的宕机并不少见,但三家在同一个时段一起中断仍然值得注意。PCMag 记者在故障中的实测是:Claude 对任何提问都返回「This response didn't load」,Grok 则显示警告称正在「经历问题」(experiencing issues)、「部分功能可能缓慢或不可用」,并把用户引向 status.x.ai,而该页面当时没有显示任何服务中断。
从时间上看,Claude 的问题最早。PCMag 记录到 Downdetector 上美东时间上午 8:30 出现小高峰,约一小时后报告转为持续攀升;OpenAI 相关的报告约从上午 10:30 开始快速增加。OpenAI 的状态页称,ChatGPT 与代码工具 Codex 在经历 24 分钟停机后已应用修复,正在「监测恢复」(monitoring the recovery);到下午 1:25,状态页更新为完全正常运行:「我们没有发现任何影响系统的问题。」据新华社引述的 Anthropic 状态页,Claude 的网站、API、Claude Code 与 Claude Cowork 请求错误率在上午全面升高。
道歉之外的缺口:SpaceXAI 没说孟菲斯为何宕机
据 引述公司状态页的记录,这次事件被标记为「模型故障」(models outage),自美西时间上午 6:30(美东 9:30)起持续约三个半小时,X 上的 Grok 与 Android、iOS 应用都受到影响。PCMag 记者的实测则显示,恢复在当天下午才完成:美东时间 3:15 仍遇到「Grok was unable to reply」报错,SpaceXAI 的道歉帖在 3:38 发出,直到下午 4 点前后,查询才恢复通过。
Engadget 同时指出,SpaceXAI 没有说明孟菲斯一侧到底发生了什么:道歉只交代了故障地点,没有交代故障本身的原因。道歉帖发出约 25 分钟后,:「我们正在采取纠正措施,确保这种情况不再发生。」(And we are taking corrective action to ensure this does not happen again)Engadget 将 SpaceXAI 称为马斯克的 AI 公司。
Claude 分两波出问题,Opus 5 与 Opus 4.8 最后恢复
Claude 的故障在 PCMag 的记录里分成两波:第一波直接命中 Claude Sonnet 5,第二波波及更多模型,包括 Mythos/Fable 5.1 与 Opus 5。Anthropic 表示修复已经推出、正在向用户铺开,当时受影响模型收窄到 Opus 5 与 Opus 4.8,Fable 系列与 Opus 4.6 已陆续恢复。9to5Google 在美东时间上午 11:49 的更新中记录了同一状态:Claude 称除 Opus 4.8 与 Opus 5 外,大部分模型已经恢复。到美东时间下午 3:15 前后,PCMag 的更新显示 Claude 状态页已回到「所有系统运行正常」(All systems operational)。
Gemini 与 Azure 只有报告激增,Cloudflare 否认涉事
Gemini 没有官方宕机记录。9to5Google 称,尽管用户报告在同一时段激增,Gemini 从未进入官方宕机状态;PCMag 记者实测 Gemini 的提示词会返回错误,但 Downdetector 上的报告量明显更小,「说明并非所有用户都受影响」。Google 始终没有确认宕机,PCMag 的后续更新确认 Gemini 已正常运行。
Azure 是当天上午被点名的一个猜测对象。9to5Google 当时写道,根本问题可能与微软 Azure 有关,理由是三家平台都依赖 Azure 提供云服务(尽管也混用包括 Google 在内的其他供应商),而 Azure 当天同样出现报告激增。9to5Google 的后续更新没有再提及 Azure;SpaceXAI 稍后给出的归因则落在孟菲斯算力中心。
Cloudflare 则直接否认。尽管 Downdetector 上同样出现了针对它的报告,Cloudflare 回应 PCMag 称:「Cloudflare 目前没有经历任何重大服务中断。我们的服务运行正常,任何与此不符的报道都是不正确的。」PCMag 注意到,这场中断的特殊之处在于,它几乎没有波及 AI 领域以外的其他业务。
三种归因并存,共同根因没有证实
新华社把三家公司的说法汇总到了一起:OpenAI 称问题源于一次「路由错误」(routing error),自美西时间上午 7:43(美东 10:43)起阻止部分用户跨平台访问 ChatGPT 与 Codex,并于约美西时间 8:17(美东 11:17)实施修复;Anthropic 称故障由「基础设施问题」(infrastructure issue)导致;SpaceXAI 则把 Grok 的中断归因于孟菲斯算力中心。
关于 SpaceXAI 与另外两家是否存在关联,Engadget 的报道提供了一条背景:Anthropic 今年早些时候与 SpaceXAI 签下协议,向后者租用算力;Anthropic 没有说明其故障是否与 SpaceXAI 的数据中心有关。至于道歉中提到的「算力合作伙伴」包括哪些公司,Engadget 写道目前「并不完全清楚」,只知道事件的时间与当天上午其他 AI 平台出问题的时段大致重合。
截至发稿(9 月 4 日),SpaceXAI 的显示「未宣布任何事件」,道歉帖没有点名任何算力合作伙伴;Engadget 报道称,Anthropic 与 OpenAI 均未立即回应置评请求。新华社在报道结尾写道:公开信息尚未确认 OpenAI、Anthropic 与 SpaceXAI 的宕机是否源于共同原因。