黄仁勋的护城河,被谷歌一行代码凿穿

新智元 · 经八阕原文

英伟达死守的推理性价比神话,碎了。

就在刚刚,SemiAnalysis发布了谷歌第七代TPU Ironwood的首份第三方推理性能测算。

在完全对等的模型负载下,TPU的每美元性能最高领先英伟达B200达50%,对B300的领先幅度更是逼近翻倍的96%!

外部TCO口径下每百万token成本 vs 交互速度

换算成业界最敏感的每百万Token成本,差距触目惊心。

TPU仅需0.181美元,B200为0.222美元,B300则高达0.276美元。

更戏剧性的,是时间。

今年4月,黄仁勋在Dwarkesh播客上宣称TPU与Trainium都不敢来跑分。他甚至公开鼓励挑战者使用InferenceMAX来证明其所谓的推理成本优势。

五个月后的今天,TPU带着致命的数据如约而至。

黄仁勋的三次断言

在那期播客中,黄仁勋对TPU的战略藐视可以归结为三次断言。

第一句,他表示极度渴望看到对手证明TPU的成本优势,并认定这在逻辑上根本无法成立。

这次的测试方法,完全公平公正——

同款开源模型,FP8对FP8,输入8k输出1k,B200与B300跑的是和TPU完全一致的负载。

在每秒100 Token的单用户吞吐基准下,TPU比B200便宜19%,比B300便宜34%。

若将中位响应时间卡在20秒,TPU成本为0.098美元,B200是0.106美元,B300则飙升至0.132美元。

B200并未在所有指标上落败。在30秒响应时间的狭窄区间内它依然维持着微弱的抵抗。但随着延迟要求放宽,TPU重新接管了制高点。

至于B300,则全程处于成本劣势。

每百万token成本 vs 端到端延迟

第二句,他声称从第一性原理来看,TPU的优势完全没有道理。

物理测试并未推翻他的底层推演,黄仁勋只是算错了商业世界的算盘。

在原始吞吐曲线的大部分区间内,TPU的物理性能确实不及GPU。但TPU的每小时租赁成本呈现出断崖式的低廉。

5%的物理吞吐优势叠加极低的单位时间租金,瞬间转化为50%的每美元性价比优势。

若按谷歌内部每颗芯片一小时1.03美元的底线成本核算,这一优势将被放大至77%乃至130%。

单加速器吞吐 vs 交互速度

黄仁勋计算的是单颗芯片榨出的绝对算力,而商业客户衡量的是每一张钞票能买到的实际产出。

这次公开的跑分数据直接击穿了客户侧的心理防线。

谷歌内部TCO口径

第三句,他断定Anthropic只是特例,失去Anthropic的支撑TPU将彻底丧失增长引擎。

这项断言目前仅维持了表面上的成立。

Anthropic确实吞下了超过100万颗TPU,其中约40万颗直接买断,60万颗通过谷歌云租赁。到2029年它将超越DeepMind成为全球最大的TPU单一用户。

但另一半断言正在迅速失效。

谷歌自去年起便开放了芯片直售,不再死守云端租赁这一单一城池。就连DeepMind内部的研究员,如今也需要在拥挤的队列中抢夺算力资源。

黄仁勋4月敢那么说,是因为TPU在外面从来没有标过价。

现在,价标出来了,还是别人替谷歌标的。

TPU的成本深水区

一颗专用芯片究竟如何实现对通用GPU的成本倾轧?

对此,SemiAnalysis在底层逻辑上揭示了谷歌截然不同的工程哲学——

谷歌从不单一追求芯片的物理峰值,而是将计算Die、芯片间互联以及底层编译器铸造成一个闭环系统,在每一处接缝中压榨成本。

芯片层面,Ironwood被物理拆解为两个独立的计算Die,每颗内嵌2个TensorCore与4个SparseCore。

其HBM容量达到了上一代Trillium的6倍。这个数直接决定KV Cache能放多大、Batch能开多大。

它更是第一代原生支持FP8运算的TPU,彻底告别了此前数代的软件模拟妥协。

矩阵单元采用256×256的脉动阵列,每周期完成65536次乘加运算,计算吞吐量直接飙升至v5架构的4倍。

这条路线到第八代走得更绝:谷歌第一次把训练和推理拆成8t、8i两颗芯片,8i的片上SRAM扩到384MB、是上代3倍,专门把推理模型的KV Cache留在片上。

谷歌TPU各代规格对比

网络互联方面,芯片之间直接通过谷歌自研的ICI总线进行数据交互,彻底绕开主机CPU、PCIe与通用网卡。

其拓扑结构呈3D Torus形态,每颗芯片物理链接6个相邻节点,64颗组建为一个机架级立方体,再通过光学电路交换机一路拼接至9216颗芯片的超级矩阵。

TPU v7的4×4×4立方体逻辑配置

任何一条光纤链路发生故障,系统都能利用光学反射镜在数秒内完成重路由,不需要人工干预。

到TPU 8i,3D Torus会换成Boardfly拓扑,千颗芯片规模下最大跳数从16砍到7,MoE路由和多轮Agent里每一跳堆出来的尾延迟直接减半。

Google,TPU 8i的Boardfly拓扑

来源:新智元(经八阕转载) · 查看原文
Scroll for more