可靠性问题出现后 SpaceX 对 xAI 数据中心基础设施进行了彻底检修
核心要点
- 在没有备用电源和冷却系统的情况下运行数月,迫使为谷歌和其他主要人工智能客户提供服务的设施进行了战略性检修。
- SpaceX 正在彻底改革 xAI 数据中心的构建和测试方式,此前其位于田纳西州和密西西比州的数据中心在没有完整的备用电源和冷却系统的情况下运行了数月。
- SpaceX 需要从 1.4 吉瓦增长到超

在没有备用电源和冷却系统的情况下运行数月,迫使为谷歌和其他主要人工智能客户提供服务的设施进行了战略性检修。
SpaceX 正在彻底改革 xAI 数据中心的构建和测试方式,此前其位于田纳西州和密西西比州的数据中心在没有完整的备用电源和冷却系统的情况下运行了数月。结果正是您所期望的:服务中断、AI 训练运行中断以及正常运行时间低于该公司让其最大客户满意所需的 99.9% 目标。
这些客户包括谷歌,该公司签署了一份每月价值 9.2 亿美元的协议,获得大约 110,000 个 Nvidia GPU 的使用权。当你的每月发票看起来像一个小国家的 GDP 时,你往往会注意到灯光何时闪烁。
凯莱 为每位投资者提供灵活的超能力——一流的数据、算法和人工智能驱动的研究,尽在凯莱金融。更智能地研究 →
出了什么问题
核心问题是速度而不是稳定性。 SpaceX 一直在竞相扩展计算能力,依靠燃气轮机和 Tesla Megapack 等临时电力解决方案,而不是等待安装永久备用基础设施。
孟菲斯工厂的停电扰乱了人工智能训练过程,考虑到这些工作负载的成本和耗时,这尤其令人痛苦。据报道,这次中断影响了包括 Anthropic 和谷歌在内的主要客户,这两家公司都依赖于持续的正常运行时间来运行自己的人工智能业务。
此后,SpaceX 采取了由埃隆·马斯克 (Elon Musk) 及其团队领导的纠正措施。新方法优先考虑在施工过程中尽早安装备用电源和冷却系统,并在设施投入使用之前进行更彻底的运行前测试。
领导层改组和工程增援
可靠性问题引发了整个数据中心运营的人员变动。多名数据中心高管离职,但具体退出情况仍不清楚。
为了填补这一空缺,在 1,300 多名员工表示有兴趣调动后,SpaceX 将 300 多名 SpaceX 其他部门的工程师重新分配到数据中心工作。
正在建设的规模
截至 2026 年 6 月,SpaceX 报告其设施的计算能力为 1.4 GW。目标是到年底超过 2 吉瓦,这意味着在大约六个月内增长了约 43%。
为了应对供应链挑战,一些扩张计划已经被推迟。预计 2026 年第二季度的外部计算租赁收入将达到 26 亿美元。光是 Google 的合同(每月 9.2 亿美元,交付截止日期为 2026 年 9 月 30 日)就产生了巨大的动力,要求把事情做好,因为未能按时交付约 110,000 个 Nvidia GPU 将危及人工智能行业可能最大的经常性基础设施交易之一。
接下来的六个月将会说明一切。 SpaceX 需要从 1.4 吉瓦增长到超过 2 吉瓦,同时对现有设施进行适当的冗余改造,满足谷歌 GPU 的交付期限,并通过部分新的领导团队和数百名最近调任的工程师来完成所有这一切,这些工程师仍在跟上数据中心运营的速度。
