AI基础设施撞上“墙”

华尔街日报 · 经八阕原文

AI算力竞赛正演化为涵盖互连与内存的系统级博弈。Marvell高管表示,推理模型驱动KV缓存九个月增长约10倍,单机架内存已无法满足需求,铜连接逼近极限,光学互连与内存扩展成为算力扩张核心。定制化已成行业趋势,Marvell凭借模拟SerDes、光子织物内存及全链路定制迎来红利。

AI算力竞赛正从单纯的芯片之争,演变为一场涵盖互连、内存与网络的系统级博弈。

Marvell高管近日在Six Five Summit 2026上指出,随着推理模型驱动内存需求急剧膨胀、数据中心规模突破物理极限,铜连接已逼近性能天花板,光学互连与内存扩展技术正成为下一阶段算力扩张的核心变量。Marvell定制云解决方案业务执行副总裁Will Chu表示,市场长期聚焦于XPU本身,却忽视了围绕XPU的"附着层"——包括网络、内存、存储与安全。"每一颗XPU背后,存在三到四个甚至更多的配套定制机会,"他说,"AI基础设施正在全面走向定制化。"

数据中心网络业务集团执行副总裁Dave Lazovsky则指出,推理时计算(inference time compute)的兴起使KV缓存需求在过去九个月内膨胀约10倍,内存容量已无法在单一机架内满足,规模化部署必须突破至更大的互连域。

上述判断对市场具有直接投资含义:内存厂商、光学互连供应商及定制硅片设计公司将持续受益于这一结构性需求。分析机构预测,2025年至2030年全球数据中心基础设施累计资本支出将达4至5万亿美元。

铜连接逼近极限,光学互连迎来"必选项"时刻

Dave Lazovsky将"从铜到光"的转变定性为AI基础设施的"强制函数",而非可选升级。驱动因素在于模型本身的演进逻辑:初代超大规模基础模型确立了对总内存容量的基础需求,而推理模型的兴起叠加KV缓存的爆炸式增长,使得单机架内的HBM容量已无法支撑前沿模型的运行。

"你别无选择,"他说,"必须将互连规模从144个XPU扩展至下一波约576个XPU的Pod,并持续向上扩展。"这一扩展的物理前提,是从铜基互连切换至光学互连。

Marvell目前同时推进板载光学(NPO)与共封装光学(CPO)两条路径,并已在以太网和UAL协议的交换机上落地CPO方案。Will Chu补充称,Marvell可为客户提供从传统铜方案到NPO再到CPO的完整迁移路径,并能将定制化延伸至从计算单元、IO接口直至交换机端口的全链路。

Dave Lazovsky特别强调了Marvell模拟SerDes技术的差异化价值:相比传统2.4T SerDes的光学链路,基于模拟SerDes的规模扩展(Scale Up)网络可将功耗降低约4倍,预计在全面部署后可实现数据中心整体能耗降低25%以上。在电力基础设施严重短缺的背景下,这一效率优势的战略意义正在快速上升。

内存墙:多层次技术组合应对爆炸式需求

Will Chu将内存瓶颈描述为当前AI基础设施面临的核心工程挑战,并将Marvell的应对策略拆解为从芯片内部到机架外部的多个层次。

在芯片内部,Marvell正投入专有的高密度SRAM IP,通过与计算单元的紧耦合设计提升性能并支持更大模型的片上驻留。他表示,传统的通用内存编译方案已难以满足客户需求。

在芯片外部,路径依次为:集成定制HBM以提升带宽和容量;3D堆叠技术将内存直接置于逻辑芯片之上;通过CXL或专有协议实现内存扩展,以容量换带宽;以及通过Marvell在FMS上发布的光子织物内存(Photonic Fabric Memory)设备,提供独立机架空间内32TB的外挂内存池。

Dave Lazovsky进一步介绍,该光子织物内存系统同时整合了DDR的容量与成本优势,以及HBM的高带宽与多伪通道并行特性,目标是让客户首次实现内存容量与带宽的独立扩展,彻底解耦于计算资源。

Will Chu还指出,高企的内存价格正倒逼超大规模云厂商重新审视其整体基础设施架构。Marvell的CXL产品已获得可观的需求,部分来自希望将旧内存接入新服务器、并通过内存压缩实现2倍等效容量的客户。Flash层级的内存分层方案也已进入厂商视野,作为成本更低的容量补充选项。

规模扩展网络:定制化成为超大规模厂商的标配

Dave Lazovsky指出,目前约四家公司占据数据中心基础设施总可寻址市场的75%以上。这种高度集中的市场结构,使得Marvell能够实施一种与服务分散客户群截然不同的商业模式——将自身深度嵌入客户的开发团队,提前数年协同架构下一代交换机需求。

他描述了当前规模扩展网络(Scale Up Network)的三种主要路径:部分厂商倾向于以太网方案;另一路线采用UAL协议,这是一种类似NVLink的基于内存语义加载-存储的高性能网络,Dave Lazovsky认为其本质效率高于以太网数据包传输;还有一家厂商正在部署完全自研的专有拓扑网络。

Will Chu补充称,XPU与规模扩展网络之间的紧密耦合,必然导致协议层和优化策略的深度定制,并最终固化为定制硅片。"不是每家公司都能做到端到端,"他说,"而我们不仅能做到,还能作为客户开发团队的延伸,直接参与其最核心基础设施的设计。"

Dave Lazovsky也表示,Marvell与头部超大规模厂商及GPU制造商建立的长期信任关系,是公司最重要的资产之一,"这需要多年积累,而我们已经拥有了这种信任。"

以下为访谈全文:

Patrick Moorhead|00:17

欢迎来到 Six Five Summit 2026。今年的主题是“释放 AI 潜能”。和我一起主持的是 Daniel Newman。朋友,你最近怎么样?

Daniel Newman|00:38

挺好的。今年的变化真令人惊叹:算力当然仍然非常重要,但连接技术已经走到了舞台中央,围绕它的讨论非常多。

我们一直在从一个瓶颈转向下一个瓶颈。正如你说的,连接技术如今成了焦点,但今年我们几乎把各种瓶颈都经历了一遍。先是算力,接着 CPU 的重要性超过了 GPU,然后内存又成了关键。再后来,焦点不仅是连接技术,而是进一步转向了光互连。如果你愿意,我们还可以聊能源。Pat,热点一个接着一个,今年确实精彩。

Patrick Moorhead|01:02

我们现在位于 Marvell 总部,接下来将讨论定制芯片、内存和互连技术。向大家介绍一下 Will 和 Dave,很高兴见到两位。

Dave Lazovsky|01:14

非常感谢你们邀请我们。

Patrick Moorhead|01:16

我很期待这次交流。我见过你们在台上演讲,也参加过你们的分析师日和产品说明会。今天能邀请你们来到 Six Five,真是太好了。

Daniel Newman|01:26

很高兴两位来到这里,也恭喜你们。我知道最近刚完成了一项收购,听起来进展很顺利。当然,接下来还有很多工作要做。

Pat,你提到了连接技术。Marvell 有意思的地方在于,它几乎参与了所有环节:芯片、内存、连接技术,以及纵向扩展(scale-up)、横向扩展(scale-out)和跨域扩展(scale-across)。各个领域都有布局,什么需要做就做什么。

Daniel Newman|01:49

你觉得大家知道《Mr. Mom》这部电影吗?我觉得知道。我们拭目以待。

Will,我先问你。你负责的业务是半导体领域增长最快的业务之一。我记得黄仁勋曾称你们是下一家市值达到一万亿美元的公司。这多少会带来一点压力,不过你们确实已经在朝这个方向前进。

Daniel Newman|02:12

可以说,过去几年 Marvell 能走到聚光灯下,很大程度上与定制芯片业务有关。但你们的业务还包括内存扩展架构、纵向扩展互连网络,以及跨域互连,涉及的领域非常多。

我想听听你从整体业务出发的看法。市场高度关注 XPU 和定制芯片,这种关注有哪些地方是对的,又忽略了什么?正如刚才所说,推动这一轮 AI 热潮的因素很多,并不只有 XPU 本身。

Will Chu|02:52

这是个好问题,Daniel。

Daniel Newman|02:54

铺垫了好一会儿才问出来。

Will Chu|02:55

也谢谢你们来到 Marvell。市场确实把 XPU 视为 AI 基础设施中需要定制的主要部件。因此,我们花了很多时间介绍所谓的“XPU Attach”,也就是围绕 XPU 配套的各种部件。

从整体上看,我们发现 AI 基础设施的各个方面都在走向定制化。XPU 本身当然要根据工作负载进行定制,但其周边的所有环节也一样,包括网络、内存、存储,甚至安全。这些是主要类别,我们参与了其中所有相关技术,为 XPU 提供支持,让基础设施表现得更好。

这里有很多机会。单看机会的数量,每有一个 XPU,就可能有三到四个,甚至更多与之配套的 XPU Attach 机会,用于支持下一代产品。这些又与我们提供的连接技术和网络产品相结合。所以,我们确实能提供覆盖端到端的整体解决方案。

Daniel Newman|04:06

我想,如果市场只用 XPU 来理解你们的业务,确实会漏掉很大一部分。

Dave Lazovsky|04:10

是的,这很有意思。其中一个重大机会,是 Will 的团队在定制 XPU 方面做了大量工作,而这也包括输入/输出接口,也就是 I/O。Marvell 是 I/O 技术的领先企业之一。

目前媒体和市场非常关注光互连。我认为,我们拥有全球光互连领域最强的团队。与此同时,与光互连形成互补的,是我们的 SerDes,也就是串行器/解串器技术:目前是 224 Gbps,很快将发展到 448 Gbps。把这些技术集成到 XPU 端,就能让我们优化整个网络解决方案,其中也包括纵向扩展网络连接。

Dave Lazovsky|04:55

当前市场有意思的地方,不仅在于它规模巨大——这是人类历史上最大的一轮基础设施投资——还在于它高度集中。目前,四家公司占据了数据中心基础设施总体可服务市场的 75% 以上。

这使我们能够采用一种与服务 40 家公司时完全不同的商业模式。我们可以切实按这些客户的需求提供产品,定制范围也不只限于 XPU,还包括横向扩展和纵向扩展网络。

这是一个独特的机会,让我们能够与客户深入合作。他们实际上把我们当作自身开发团队的延伸。

Daniel Newman|05:43

很有意思。我们刚发布了一份新的预测,估算从现在到 2030 年的累计资本开支。你们猜这个数字现在有多大?

Dave Lazovsky|05:57

我正想说,4.5 万亿美元。

Daniel Newman|05:59

四五万亿美元,是的。不过,整个数据中心基础设施的总投入是 12 万亿美元。你可能只考虑了芯片,我们考虑的是全部基础设施。如果只看芯片,你估算得差不多。

顺便说一句,不到一个季度之前,我们的预测还是 10.7 万亿美元。这是多大的机会,变化快得让人跟不上,实在令人惊叹。

Patrick Moorhead|06:19

我在前面的铺垫中也提到,网络和系统各部分之间的均衡一直都很重要,问题只是哪个环节最拖后腿。

从基本系统架构来看,无论 GPU 还是 XPU,当一个托盘内部已经无法满足需求,就要扩展到整个机架;一个机架不够,就连接旁边的机架。当你把大量集群整合起来,还可能需要连接外部、甚至另一个数据中心,才能完成任务。

Patrick Moorhead|06:52

现在有个争论,不仅出现在 X 上,也出现在财报电话会议中:共封装光学技术,也就是 CPO,究竟什么时候会真正普及?我们先不争论各种 CPO 形态。我想问的是,XPU 会不会成为推动 CPO 走向主流的关键力量?

Dave Lazovsky|07:16

我认为,从根本上说,推动力来自 AI 基础设施。如果追问是什么让纵向扩展网络从铜互连转向光互连成为必需,而不仅是锦上添花,答案尤其在于模型。

最初出现的是参数规模达到数万亿的大型基础模型,这对一个纵向扩展域内的内存总容量提出了相应要求。过去 24 个月,变化来自推理模型,也就是在推理时增加计算。这在存储基础模型参数之外,又增加了内存需求,即键值缓存(KV cache)。推理阶段进行更多推理和计算,会继续扩大 KV 缓存。仅在过去九个月,KV 缓存的规模就增长到了原来的约十倍,而这些都需要内存。这也是美光、海力士等存储器公司的市值如今迈上万亿美元规模的原因。

要在高速内存,也就是高带宽内存 HBM 中容纳服务这些模型所需的容量,唯一的方法就是将系统扩展到机架之外,别无选择。你必须超越 144 个互连 XPU 的规模;下一阶段,一个 pod 计算集群可能达到约 576 个 XPU,然后继续扩展。

Patrick Moorhead|08:35

在这一转变中,Marvell 处于什么位置?我们可以把范围限定在用于纵向扩展的共封装光学技术。

Dave Lazovsky|08:45

我们正在以几种不同方式实施共封装光学技术。目前大家很关注近封装光学技术 NPO 与 CPO 的区别,也就是板载光学或 NPO 与 CPO 的区别。对我们来说,无论客户问的是哪一种,答案都是“可以”。形态并不重要,因为我们拥有完整的光互连解决方案组合。

对于我们自己的交换芯片,我们对技术有信心,能够直接在封装上部署 CPO。现在,我们既在基于以太网的系统上这样做,也在用于纵向扩展的 UALink 系统上这样做。

我们也为 XPU 端提供互连方案。目前既有正在推进的 CPO 合作项目,也有多个 NPO 合作项目。把 NPO 作为首批光互连部署的一种选项,确实有助于客户更安心地采用这项技术。当然,不同方案各有取舍。

Will Chu|09:47

我补充一下 Dave 提到的 XPU 端。传统上,你可能会开发铜互连方案,例如 I/O 小芯片。但当你逐渐接近铜互连的极限、需要转向光互连时,我们已经在交换芯片端展示的完整技术组合,也可以用于 XPU 端,帮助客户从传统铜互连过渡到 NPO,再到 CPO。

我们可以根据客户转型的速度、节奏和具体要求,对整个方案进行定制:从计算部分到 I/O,再延伸到链路另一端的交换芯片,并覆盖返回方向。因此,我们确实拥有完整的产品和技术组合。

Dave Lazovsky|10:24

接着最后一点说,在链路两端采用相同的 I/O,对客户极具价值,尤其是在纵向扩展链路上。确保纵向扩展网络的链路不出问题至关重要。

不论是在 XPU 与我们的纵向扩展交换芯片之间,链路两端同时采用 224 Gbps 铜互连 SerDes,还是同时采用我们的光互连,都是如此。

我们的光互连包括所谓的 Fast Pipe,速率从 200 Gbps 向 400 Gbps 演进;还有原转写中称为“Flat Pipe”的方案,采用 56 Gbps 非归零编码(NRZ),向约 112 Gbps 演进。模拟 SerDes 的能效要高得多。

Will Chu|11:05

再补充一点:能够实现这种端到端方案的公司为数不多,我们是其中之一。我们实际上会一起与客户讨论链路两端的设计,研究如何让下一代基础设施满足他们的需求。这也回到了开头的话题:我们并不只是一家 XPU 公司。

来源:华尔街日报(经八阕转载) · 查看原文
Scroll for more