AI回答你一句话,背后发生了什么?

华尔街日报 · 经八阕原文

MoE架构将推理拆解为预填充、中间填充、解码注意力与解码专家四个阶段,各阶段硬件需求截然不同。Semianalysis认为内存带宽比内存容量更值钱,堆容量不如提速度。聚合式与分离式架构之争本质是"全能芯片"能否实现的赌注。调度层成为隐形价值洼地,KV缓存分级存储管理将催生新兴存储赛道机会。

当你向AI提问并收到回复,这个看似瞬间完成的交互背后,是一套横跨计算、存储、内存与网络调度的复杂工业体系。

9月22日,研究机构SemiAnalysis发布深度技术报告,系统拆解了大模型推理服务的底层架构。从用户发出请求到AI生成每一个token,每个环节如何运作、哪里是瓶颈、什么样的硬件在什么阶段真正创造价值。

报告指出,推理服务并非一个整体,而是由预填充(Prefill)、中间填充(Midfill)、解码注意力(Decode Attention)和解码专家(Decode Experts)四个工作阶段构成的"Token工厂"。

这一分析框架对于理解AI基础设施竞争的核心逻辑具有重要参考价值。每个阶段对算力、内存带宽和网络的需求截然不同,混同处理将损失混合专家(MoE)模型架构的结构性优势。

报告以英伟达Blackwell系列GPU为案例进行推演,其结论对硬件设计者、云服务商和模型部署方均具有直接指导意义。

"专家工厂"的诞生:MoE改变了什么

过去,我们讨论大模型,习惯用参数量说话——千亿、万亿,数字越大越震撼。但MoE的出现,让这种比较方式变得苍白。它真正改变的,不再是参数的总量,关键是哪些参数在哪个时刻被激活。

具体来说:每次处理一个词元Token(可以简单理解为一个词或一个字),MoE模型不会让全部参数都参与计算。它有一个"路由器",会为每个Token精准定位出少数几个最合适的"专家模块",让这些专家各司其职,处理完再把结果汇总。

这就好比一家超级医院,每个病人进门不是被所有科室的医生轮流问诊,而是智能分诊系统直接把他送到最对口的两三位专科医生面前。

这个机制带来了一系列连锁反应:

哪些数据必须"住"在离计算最近的地方,发生了根本变化;

内存、带宽、存储的价值权重,被彻底重新排列;

调度系统的复杂度,从线性增长变成了指数级跃迁。

换句话说,MoE让整个推理系统变成了一座需要精密协调的"智能工厂"。

推理服务是一座分工明确的流水线工厂

SemiAnalysis报告指出,AI推理服务是一个由多个专用工作节点池构成的循环系统,而非运行在单一服务器上的程序。

用户或其代理发出请求后,调度层(如英伟达Dynamo或Mooncake)将其放入队列,分配给输入填充工作节点处理。该节点负责将用户输入连同历史对话状态转化为新的上下文,再交由解码工作节点反复读取已积累的状态、逐步生成回答token。

在智能体(Agent)场景下,这一流程还会与工具调用、外部搜索等环节交织,形成每小时可达数千次的对话轮次。

每一轮对话产生的"记忆",在系统内部以一种叫做KV状态的形式存储。这些状态被设计成不可变的数据块(blob),像区块链账本上的记录一样,一旦生成便不再修改,只会不断追加。

为什么要这样设计?因为AI对话天然是因果推进的——后一句话的理解,依赖于前面所有内容的积累。不可变结构,完美契合了这种单向流动的特性。

来源:华尔街日报(经八阕转载) · 查看原文
Scroll for more