全世界搞AI的,为啥都在抢中国电池?

酷玩实验室 · 经八阕原文

这两年,AI军备竞赛打得那叫一个昏天黑地,在中美都是拉动投资的主力。

GPU、存储、光模块、液冷,算力基建的市场热点一轮接一轮地爆发。

另外,GPU芯片非常吃电,一座大型AI算力中心一年电费动辄几十个亿,顶得上一座小城市。

即便你掏得出几十亿,也不一定能抢到电。

在美国一些地区,AI算力中心接入电网要排队3到7年。于是马斯克、扎克伯格这些人都等不及了,纷纷开始购买燃气轮机自建电厂。

这使得跟AI算力貌似不搭噶的一众电力设备,燃气轮机、变压器、高压开关等等,也跟着一起鸡犬升天了。

但在一个大多数人没有注意到的角落,AI相关的储能,也就是电池业务,也在暴涨。

2026年前5个月,全球AI算力中心储能出货量达到10GWh,按电池容量计算相当于1000万度电,已经超过2025年全年。行业预计,到2030年,AIDC储能锂电池出货量将突破300GWh。按眼下的出货量级看,短短几年就是几十倍的增长空间,毫不意外的是,新增订单,大部分都流向了中国电池厂。

为啥AI计算需要这么多电池呢?今天我们就来深度聊聊。

01 几万块GPU同时猛踩油门

你对数据中心的印象可能是这样的:一排排服务器安安静静闪着绿灯,嗡嗡作响,用电也相对平稳。

传统数据中心确实是这样,单个机柜功耗4到8千瓦,负荷稳稳当当,像定速巡航,电网轻轻松松,如沐春风。

但AI算力中心完全不一样。

比如一块英伟达B200 GPU在满负荷运行时,功耗可以达到1200瓦;一套GB200超级芯片可以达到2700瓦。

一个NVL72机柜里塞了72块GPU,整柜功耗飙到120到140千瓦,是传统机柜的20倍。

英伟达GB200 NVL72液冷机柜 | 来源:NVIDIA

但功耗大还不是最要命的,最要命的是AI的功耗会“跳”。

大模型训练时,成千上万块GPU会同时计算,并在每一轮结束后交换计算结果,这个过程叫AllReduce。你可以把它想象成一个几万人的大合唱团,每唱完一段所有人必须停下来对谱,等最慢的那个人跟上,然后再一起开唱。

结果就是所有GPU要么同时满功率运转,要么同时空转等待。用电曲线变成“方波”:满功率→空转→满功率→空转,不断重复。

方波大概长这样

有储能工程师打过一个比方:GPU的用电就像一辆每秒从怠速踩到满油门又松掉的跑车。

Vertiv的实测数据显示,GPU机柜的负荷可以在极短时间内从约10%跃升至满载甚至超出额定功率的150%,呈现高频脉冲式波动。

这种波动放大到几万张卡的集群上,处理不好的话,就相当于你的显卡在用电磁脉冲震荡攻击你的电源。

当年Meta训练Llama 3时,使用了两个各有约24000块H100 GPU的集群。单个集群中,仅服务器等IT设备的合计用电功率就达到数十兆瓦。大规模训练时,成千上万块GPU同步切换状态,汇聚到电网侧,就会形成数十兆瓦的功率冲击。

有人可能会觉得,跳就跳呗,电网不是专门干这个的吗?

问题在于,电网是为平稳用电设计的,调度指令下达后,从电厂增容到电流送到用户端,反应以秒计;但GPU的功率跳动以毫秒计,根本不是一个节奏啊。

电网来不及响应,电压就可能突然下跌。

你家里的灯闪一下,你人可能感觉不到;但对正在训练大模型的GPU来说,电压异常哪怕只持续10毫秒,也可能导致这一轮训练失败,轻则回滚到上一个检查点,重则整段重新计算。

传统数据中心的标配方案叫UPS,也就是不间断电源。本质上就是一组大型铅酸电池放在楼下配电间,平时充满电待命,外部电源一断就顶上去,撑到柴油发电机启动。

数据中心UPS

备用柴油发电机 | 来源:Google Data Centers

过去几十年,数据中心就是靠这套系统活下来的。

但UPS是为防止突然停电设计的,不是为电压跳动设计的。铅酸电池响应速度在10毫秒以上,而且是集中式部署,一栋楼共用一套UPS,中间隔着长长的输电线路。

GPU要的是毫秒级、分布式的贴身供电,UPS从架构上就不行:反应太慢,离GPU太远,一出故障还影响一大片。

离GPU最近的第一道防线,是电容。

英伟达在GB300机柜的电源架里,把剩下的空间都装上了电容。GPU功率一冲高,它就放电;功率一回落,它就充电,把最频繁的那些小尖峰就地削平。

电容靠物理方式存电,不像电池要靠化学反应,隔几秒就充放一轮也不伤寿命。但它存的电能少得可怜,每块GPU只分到65焦耳,差不多够一个60瓦灯泡亮一秒,所以它只能管抖动,管不了波动。

AI算力中心催生出来的电池需求叫做BBU,也就是电池备份单元。

它和UPS最大的区别在于:BBU不在楼下,就在机柜里面,和GPU住同一个柜子。

一台NVL72机柜里装24个BBU,电芯是21700高倍率圆柱锂电池,放电倍率≥10C,响应时间不到2毫秒。

GPU功率骤升的瞬间,旁边的BBU在2毫秒内放电补位,撑住电压,等电网几秒后完成调节,BBU再平滑退出。

但电容和BBU只管机柜内部毫秒级的急救,一个大型AI数据中心成百上千个机柜同时暴跳,叠加起来的冲击达到几十兆瓦。

这就需要整个园区级别的储能系统来扛:几十个集装箱大小的储能柜围在园区周边,总容量几百兆瓦时,专门应对所有机柜叠加起来的秒级到分钟级的功率波动。

总的来说,传统储能像蓄水池,慢慢蓄、慢慢放,讲究的是一个容量大、成本低。

AIDC储能则像是急救队,GPU一喊饿,电得瞬间到位。电容和BBU管毫秒,园区储能管秒到分钟,三层合在一起,才算把GPU这个电力黑洞喂饱。

02 算力中心开始抢电池

AIDC储能需求的爆发是全球性的。

机柜级BBU正在迅速变得供不应求,2025年全球BBU市场约35亿元,预计2030年达350亿元,五年翻十倍,年复合增长率近六成。

这股需求来得这么急,最直接的原因是算力中心建得比电网快。

接入电网往往要排队3到7年,但老板们等不了,晚投产一个月,就是真金白银的算力收入在流失。

那怎么办呢?一般就两条路,而这两条路都越来越离不开储能。

来源:酷玩实验室(经八阕转载) · 查看原文
Scroll for more