DeepSeek V4.1重回国产一哥

量子位 · 经八阕原文

DeepSeek V4.1 Flash上线,跑分重回国产一哥!

而且这次,是完全重新训练的非对称模型新架构。

552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder结构,输入和输出不对称,输入激活只有8B,输出激活16B。

这种架构成本显著低于已知的同尺寸模型,难怪这两天测试感觉速度飞快,原来不光是因为用的人少。

这次重新预训练、用了新的数据、强化学习后训练规模更大,训练过程还与新版DeepSeek Harness v0.1.5深度结合。

所以Flash打败自家Pro(除了知识容量),昨天还觉得离谱,今天一下子合理了起来。

V4.1 Flash也是DeepSeek首个原生支持多模态视觉理解的正式版模型,此前视觉能力以实验版V4 Flash Vision Exp的形式单独提供,现在统一到了一个模型里。

再加上9月14日起所有V4 Pro的请求会被重新路由到V4.1 Flash。

所以未来一段时间内,直到V4.1 Pro上线,DeepSeek API将只提供这一个模型。

此外,还有一个能影响整个行业的消息。

推理效率方面,V4.1 Flash的KV Cache缓存大小相比上一代模型,对HBM的需求减少到1/4,对SSD的需求减少到1/8。

从初代V1到V4.1 Flash,KV Cache足足缩小到原来的1/437。

咱就是想问,内存啥时候降价?

51页论文解析

模型变化这么大,论文也少不了,刚放出的pdf足足有51页。

从标题就在强调“把KV缓存压缩到极致”。

究竟怎么压缩这么狠的呢,先从架构开始说起。

非对称Transformer,提示词不必走完整40层

新架构是40层因果Transformer,被切分为前20层的因果编码器和后20层的解码器,这套结构命名为Causal Encoder-Decoder(CED)。

CED受YoCo架构启发,但做了一系列结构改进来提升KV Cache容量和KV生成的计算深度。

CED的核心在于非对称。编码器处理输入时激活8B参数,解码器生成输出时激活16B参数。

在Agent工作负载中,频繁的工具调用会产生大量prefill请求,CED的处理方式是:解码器的全局KV Cache不从各层自身的隐藏状态生成,而是直接从编码器最后一层(第20层)的隐藏状态投射得到,每层使用独立的投射权重。

这样一来,大部分prompt token只需通过前20层编码器,不必再走完整的40层。

对于序列长度远大于滑动窗口的场景,prefill计算复杂度直接从O(NL)降至约O(NL/2),接近减半。

CSA2注意力:沿三个维度同时压缩缓存

接下来是注意力机制的改动。

Compressed Sparse Attention 2(CSA2)取代了V4中CSA与HCA的混合架构。

CSA2沿三个维度同时压缩缓存:条目大小、序列维度和层维度。

跨层复用全局KV和Top-K索引来减少存储和计算。

CSA2的压缩器和索引器也做了简化,去掉了CSA中相邻压缩条目之间的重叠和绝对位置嵌入,索引器K改为从主KV条目投射获得,而非从隐藏状态单独压缩。

CSA2定义了三种静态分配的工作模式。

▪︎Full模式执行完整计算路径,生成自己的全局KV,投射索引器K,运行索引器产生Top-K索引。

▪︎Reindex模式复用前序Full层的全局KV和索引器K,但用自己的索引器查询重新评分,选出新的Top-K。

▪︎Reuse模式最轻量,直接复用前序层的全局KV和Top-K索引,不做任何索引计算。三种模式下每层都保留自己的查询和滑动窗口KV(SWA KV)。

三种模式下每层仍保留自己的查询和滑动窗口KV。编码器以少数纯SWA层开场,其余按组编排,每组一个Full带若干Reuse;解码器则大量使用Reindex打头的组,在复用缓存的同时保留逐层重新选择注意力目标的能力。

解码器另外引入层次化稀疏索引器。

第一个Full层在扫描全部可见位置的同时,通过逐块评分构建一个共享候选池;后续Reindex层只在池内搜索。

由于池的大小固定,深层索引器的每查询计算量不再随上下文长度增长。这个机制是training-aware的,在后训练中引入,训练与推理施加相同的候选约束。

缓存精度与持久化分层

缓存精度上,V4.1 Flash将主KV Cache从FP8进一步压到FP4,采用分组缩放因子的E2M1方案,并在论证数值范围安全后省略了二级全局缩放因子。

对量化更敏感的SWA KV仍保留FP8。FP4通过QAT在后训练阶段引入,量化点选在RoPE之后——放在之前只有边际精度收益,却要付出解码开销。

部署侧引入SWA Bounded Replay。

上一代精确重建SWA KV需要按层数成倍回放token,生产环境成本过高,V4.1改为只回放最近一个窗口的token做近似重建,对响应质量影响可忽略。

于是KV Cache被拆成两级,SWA KV移出持久化层,改放在各机预留的一小部分主机DRAM组成的分布式内存池中,TTL只有分钟级,过期即回收;全局KV留在SSD上的持久化缓存,保证数十小时生命周期。

其他架构扩展

- Single-Pass mHC:将输入混合系数偏移一个块,消除原始多核实现中的数据依赖;配合Mega-mHC部署内核,激活内存流量减半并触到理想下界。

- Engram条件记忆模块:在浅层和中层各插入一处,多阶n-gram、多hash head索引,推理时通过后台RDMA从主机内存预取嵌入。它贡献了模型中相当大比例的参数量。

- DSpark投机解码:在骨干冻结后独立训练,用少量Transformer块并行产出多个草稿位置的logits,配一个Markov head建模草稿token间依赖、一个置信度head预测逐位置接受概率,调度器再结合引擎吞吐曲线为每个请求动态选择验证长度。

45万亿token预训练,后训练只改数据不改算法

预训练,数据重新清洗

模型在数十万亿token的多模态语料上预训练,全程无不稳定。

稀疏注意力从零开始训练,没有任何密集注意力预热阶段;多模态数据从第一步就混入;长上下文扩展在训练后段一次完成。

这次DeepSeek在数据侧提出两个判断。

一是把弱模型生成内容和低质量机器翻译定义为“隐性重复”并过滤掉,理由是它们主要是对已有信息的改写,在长训练周期中可能有害。

二是发现爬虫系统过度偏向纯文本网页,于是从Common Crawl重新引导抓取以提高多模态来源覆盖。

交错图文数据的构建被组织成成本递增的流水线:在昂贵的图像检索之前先用启发式过滤、去重和质量模型筛出高价值文档,组装成交错序列后再做图像感知的过滤与去重,最后交给VLM严格评分;被淘汰的文档还会部分回收为图文对。

优化器是分层的:线性变换权重用Muon,归一化与非矩阵参数用AdamW,嵌入表和预测头则用基于Sinkhorn平衡的动量更新。交替对行列归一化以近似均衡更新矩阵的行列RMS,只需一个动量缓冲区而非Adam的两个状态,直接压掉了巨量Engram参数带来的优化器状态内存。

Q/K权重使用head-wise Muon,为不同注意力头提供不同预条件器。视觉编码器在学习率衰减前保持冻结,仅归一化层与投射器可训练,衰减开始后再以更小学习率解冻联合优化。

后训练,只改数据不改算法

这次V4.1 Flash后训练流程沿用SFT + RL + OPD的标准范式,所有改变集中在数据与环境管线。

原文写道:“在当前阶段,工程化数据和环境管线的边际回报远超后训练中算法创新的边际回报。”

任务合成管线把每个训练任务形式化为(问题、环境、验证系统)三元组,沿难度与正确性两个维度评估,再用这两个信号迭代训练“造任务的模型”,并在任务每次进入新的RL运行时用产生的轨迹重新审计质量。

来源:量子位(经八阕转载) · 查看原文
Scroll for more