xAI 调查服务中断时 Grok 遇到问题
核心要点
- xAI 开发的生成式 AI 聊天机器人 Grok 遇到服务问题,引发了对中断的调查。
- 在此之前,Grok 在 3 月 10 日记录了一次较长时间的中断,持续了 2 小时 24 分钟。
- 另一次中断发生在 7 月 1 日,持续了大约一个小时,与 Grok Build 0.1 有关。

由埃隆·马斯克 (Elon Musk) 的 xAI 构建的人工智能聊天机器人在 2026 年面临着短暂的中断,引发了有关基础设施准备情况的问题。
xAI 开发的生成式 AI 聊天机器人 Grok 遇到服务问题,引发了对中断的调查。该事件使该平台在 2026 年经历了越来越多的中断,其中大多数与保持 GPU 集群在重负载下保持正常运行的挑战有关。
短暂但反复出现的中断模式
今年最引人注目的故障发生在 8 月 17 日,当时 xAI 报告其 grok-4.6 和 grok-4.5 模型的首个令牌延迟时间延长且错误率达到 500。根本原因可追溯到 GPU 集群问题。该事件于美国东部时间下午 5:57 开始,并于晚上 7:28 解决,时间大约为 1 小时 30 分钟。
在此之前,Grok 在 3 月 10 日记录了一次较长时间的中断,持续了 2 小时 24 分钟。另一次中断发生在 7 月 1 日,持续了大约一个小时,与 Grok Build 0.1 有关。
当前状态和用户所看到的内容
截至 9 月 3 日,xAI 的官方状态页面显示 Grok 核心服务的主动中断为零。其中包括 Grok Web 应用程序、X(以前称为 Twitter)内的 Grok 集成以及 us-east-1 API 端点。
第三方监控平台的情况略有不同。 DownDetector 和 Tickerr 等服务最近几个小时记录了分散的用户报告,涉及错误、延迟峰值和登录困难。与今年早些时候的高峰事件相比,投诉量仍然较低。没有任何公开声明表明除了常规事件响应之外正在进行正式调查;过去的事件已通过状态更新在内部处理。
xAI 维护详细的状态页面,记录带有时间戳、根本原因和解决窗口的事件。
为什么基础设施不断阻碍人工智能平台的发展
8 月 17 日的停电说明了一个反复出现的挑战。单个 GPU 集群问题会导致两个模型版本的错误率升高,影响整个用户群长达 90 分钟。 Grok 在六个月内记录了三起值得注意的事件。
us-east-1 端点是唯一列出的 API 区域,这也引发了有关地理冗余的问题,因为单区域架构本质上更容易受到局部故障的影响。
