DeepSeek V4正式版太便宜辣量子位

8/3/2026

DeepSeek V4 Flash,太便宜辣!!

一次提示直出第一人称3D射击游戏——

能跑能跳能打枪,地图掩体物理碰撞全部到位,UI右下角还实时显示弹匣余量。

大制作啊大制作,结果一看账单这一整套才0.07美元,那不就是5……毛钱!?

也就是说2美元能玩上一整天,难怪网友都有点绷不住了(doge)。

DeepSeek V4 Flash正式版API上线公测之后,大家不忙着跑分了,全网都在算:

V4 Flash和Opus 5比便宜几倍,和GPT-5.6比省了多少……

账单一晒结论高度一致:DeepSeek V4 Flash,便宜得离谱。

1美分 vs. 1美元

光看DeepSeek自己还不够直观,咱们直接上对比!

Claude Opus 5和DeepSeek V4 Flash 0731的发布只隔了7天。

既然赶这么近,就有网友给它俩摆一块儿跑了同款太空射击游戏。

两者均完整实现战机移动、射击、击碎陨石、道具拾取等功能,可玩性几乎没有拉开明显差距。

单看交付的顺滑度,Opus 5倒是一把过,V4 Flash磨了三次才成。

但Opus那版代码体量接近3000行,V4 Flash那版大概900行,用了三分之一不到的代码量,价格也直接便宜了两个数量级——

1美分 vs 1美元。

可是!100倍的差价摆在面前,成品功能却几乎看不出太大差别。

再来看看森林划船小游戏,是V4 Flash和GPT 5.6 Sol的同款对比。

两者都做出了完整3D河道场景、左右方向操控、障碍物碰撞计分、动态树木远景这套核心玩法,不管是交互逻辑还是画面风格几乎趋同(除了deepseek的造景都小一码)。

再看一眼账单,惊了。

这次是0.05美元 vs 2.47美元,V4 Flash整整便宜50倍。

这位大哥也忍不住感叹:定价简直让人难以置信,便宜得离谱了吧……

再来一组宝可梦3D模型对照,用一模一样的需求指令分别调用GPT-5.6 Luna、DeepSeek V4 Flash 0731。

成品效果一时分不出好坏,但token输出差距非常直观了。

最终GPT-5.6 Luna输出高达230万+ token;相同情况下DeepSeek V4 Flash仅输出47.7万Token,

换算下来整套任务成本相差近14倍。

只能说,这么多对比下来,V4 Flash每一次的效果可能不是最好的,但一定是最值的。

被DeepSeek V4 Flash捂住了钱包

那问题就来了,DeepSeek V4 Flash到底为啥能做到这么便宜?

最核心的还是MoE架构,作为V4家族一员,Flash总参数依然是284B,每次推理只激活13B。

跟MoE配合的是CSA+HCA混合压缩注意力。

上下文拉到100万token的时候,不用每个新词都把全部历史翻一遍,先压缩再筛选,只有必要时才回看全局,降低百万级上下文下的KV缓存压力。

这样,KV缓存省了,显存省了,每步推理的算力也省了。

再往下是权重,V4用的是FP4+FP8混合,专家权重能压多低压多低,推理不失精度,但存储和搬运成本直线下降。

0731这个正式版,底层模型骨架、参数数量、注意力结构、量化方案,跟预览版100%一致,

只重做了后训练,把SFT监督微调和GRPO强化学习重新磨了一遍,再加了个DSpark投机解码做推理加速,拉高服务器并发吞吐。

Scroll for more