SpaceX全面调整:扩建放缓,强化可靠性
据报道,马斯克对数据中心管理层实施大规模调整,由火箭业务老将出任负责人。新管理团队要求在数据中心投入运营前完成更全面的测试,加装更多电力与冷却备用系统,牺牲建设速度来换取更高的可靠性。上周孟菲斯数据中心断电事故导致部分Grok模型下线,并对Anthropic、谷歌等算力租赁客户产生连锁影响。
SpaceX正对其数据中心建设方式进行系统性改革,以可靠性换取速度的战略转变,标志着马斯克旗下AI业务在基础设施扩张路径上的重要拐点。
据The Information援引知情人士透露,SpaceX新任管理团队正着力加装更多电力与冷却备用系统,要求在数据中心投入运营前完成更全面的测试,并着手减少对临时性电力和冷却设备的依赖。数据中心扩张速度可能显著放缓。
这一做法与xAI此前"边建设边运营、后期补充冗余"的快速部署模式形成鲜明对比。与此同时,管理层在部分现有数据中心推进重新设计工程。
上周,施工作业意外影响一条输电线路,导致SpaceX位于田纳西州孟菲斯的大型数据中心发生一次备受关注的宕机事故。
SpaceX表示,此次故障导致部分Grok模型下线,并对Anthropic、谷歌等算力租赁客户产生连锁影响。马斯克随后在X平台发帖称,公司正在"采取纠正措施,确保此类事件不再发生"。
截至发稿,SpaceX周四美股盘中上涨1.63%,早盘受获英国政府约4000万美元卫星服务订单的消息影响,一度涨超3%,后有所回落。
此外,根据招股书披露的安排,SpaceX 9月9日前后迎来IPO后第90天的一轮解禁,最多约3.19亿股Class A普通股获得出售资格,占相关180天锁定股份约7%。
速度优先埋下隐患
SpaceX曾将极速建设数据中心视为其在AI竞赛中的核心竞争优势。
xAI曾宣称,其首座数据中心仅用122天便完成了搭载10万块GPU的上线部署——在通常需要数年才能完成同等规模建设的行业内,这一纪录被英伟达CEO黄仁勋称赞为"超人的"、"令人难以置信的"成就。
为实现这一速度,xAI调集数千名承包商,采用多工序并行作业的方式推进建设:冷却管道铺设、电气和网络布线等工序往往在同一区域同步进行,而非等待上一阶段完工后再启动下一阶段。
SpaceX甚至在今年6月的IPO文件中,将快速建设能力作为重要卖点加以强调。然而,这种激进的建设节奏带来了明显的可靠性代价。
据知情人士介绍,前两座数据中心上线时,其冗余度仅为其他超大规模云计算服务商的一小部分,这意味着单点设备故障便可能导致整个算力集群瘫痪。数据中心建成初期,频繁断电曾迫使AI研究人员将项目搁置数小时,并损失部分模型训练进度。
此外,由于团队成员曾被赋予较高的采购自主权,数据中心内部设备规格参差不齐,进一步削弱了系统稳定性。
人事大换血,火箭团队接管
今年6月下旬,马斯克对数据中心管理层实施大规模调整,由SpaceX老将Wesley Salandro接替Dan Rowland出任团队负责人。
Rowland曾主导基础设施工程工作,并一度直接向马斯克汇报;他在加入xAI之前曾参与特斯拉Dojo超级计算机项目,在Salandro接手后不久便离开了团队。Salandro在SpaceX任职超过七年,曾担任Falcon和Dragon火箭的生产副总裁。
在此之后数周内,多位核心负责人相继出走:负责物理基础设施的Jake Palmer、数据中心安全负责人Logan Beach、采购负责人Tiffany Wilson、财务负责人Pablo Mendoza均已离职。
Duke Energy站点项目工程师Aakash Verma于8月转投OpenAI,站点建设经理Brent Mayo亦随之离开。
数据中心设计参与者Liz Balke目前已加入Anthropic基础设施团队。
为填补人力缺口,SpaceX向德克萨斯州Bastrop和佛罗里达州卡纳维拉尔角的火箭及Starlink工程师发出志愿支援号召,招募参与为期六至八周的轮岗工作。据悉,逾1300名工程师报名,其中超过300人在过去一个月内正式加入数据中心项目。
重建秩序,扩张节奏趋缓
新管理层不仅调整了技术路线,也重塑了组织架构。据知情人士透露,SpaceX在此前相对扁平的管理结构中增设了多个中层管理职位,员工的设备采购授权和现场决策权随之收窄,这在客观上将进一步拖慢建设进度。
马斯克本人似乎对这一新策略持支持态度。据两位知情人士称,近几个月来他几乎每周都会造访孟菲斯的数据中心设施,通常选择在周日到访,最近一次到访正是上周日。
知情人士表示,尽管提前建设备用系统、加强测试的新做法势必放缓整体建设进程,但SpaceX可能不会完全放弃xAI此前的加速建设模式。
与此同时,在重建可靠性与保持扩张速度之间如何取得平衡,仍是这支新团队面临的核心挑战——尤其是在算力租用业务加速扩张、外部客户依赖度日益上升的当下。


