Kimi K3正式公布焚诀差评
我宣布,Kimi 正式 和 DeepSeek 一桌,成了开源界的真·活菩萨。
因为昨天晚上,Kimi K3 正式在 Hugging Face 上开源了。
半小时就在 Hugging Face 里拿下 4000 赞,可以说是有史以来最被人关注的开源模型了,估计是有不少老外和差评君一样掐点等着。
而且 Kimi 这次开的东西也不简单,除了模型的权重文件本身之外,还附带了一份详细的技术报告,带上了不少训练模型的工具一块发出来。
这下是和 DeepSeek 一样,是真把焚诀给差友们掏出来了。
各种跑分测试就不多说了,基本上各项跑分都只低于 Fable 5 和 GPT-5.6 Sol。
可以说现在的 K3,就是世界第三的模型,而且是 TOP 3 里你唯一一个可以下载到本地自己运行,自己微调的模型。
而且本身自带多模态功能,没有啥短板。
模型的参数也是比更大还更大,这次 K3 的模型总参数直接给干到了 2.8T,成为了最大的开源模型。
而且不光总参数大,模型的激活参数也是大的离谱,
在实际干活的时候,K3 能够直接激活 1042 亿的参数,这个数量是自己上一代的三倍,是 DeepSeek V4 Pro 的两倍,甚至已经比很多开源的模型本体都要大了。
为了驾驭这个夸张的数据量,这次的 K3 做了很多架构上的创新,当然,人也没藏私,直接都放在文档里光明正大的写出来了。
首先就是大家都关注的注意力方面,传统的注意力机制大家都知道,模型每读一个新词,就需要把它和前面的所有 token 都计算一遍,这样读进去的内容增长一倍,算力开销直接增长了四倍。
而 Kimi 这次为了节省算力,采用了一种叫做混合注意力的办法,信息过来,首先要过一层 KDA ( Kimi Delta Attention ),KDA 会一边读取文本,一边把关键信息写进一个持续更新的状态里。
新的内容进来之后,它还会判断哪些旧信息需要保留,哪些可以慢慢忘掉。
同时为了防止 KDA 漏掉关键信息,Kimi 还在三层 KDA 后安排了个 Gated MLA,相当于是让模型做了几页笔记后,再回头翻下原文检查一下。
通过这套组合拳,K3 大幅度降低了超长上下文的计算成本。
除此之外,Kimi 还设计了 Attention Residuals 注意力残差连接,来减少信息在传递时的丢失。
又设计了 Stable LatentMoE,把原本 7168 维的信息先压缩到 3584 维,再同时派给 16 个专家处理。
还给这些专家安排了限流和排班机制,压住异常激活值,合理分配任务。
避免有人天天 996,有人天天摸鱼的情况发生。
通过这些架构,数据和训练方法的共同升级,K3 在总参数变大的情况下,模型的训练效率,反而比上一代的 K2 提升了 2.5 倍。
而 Kimi K3 的发布和开源,也已经不是技术小圈子的自嗨了。
它像是个导火索,把各路好人坏人、牛鬼蛇神都炸出来了。
比如有美国的政客,就指控 K3 是蒸馏美国大模型整出来的。
Kimi 的员工也漂亮反讽,说 Fable 也才发没多久布,Kimi 几十天的时间蒸馏出一个模型,可以申请吉尼斯世界纪录了。
难不成中国人人均超能力,蒸馏了 Anthropic 未来准备发布的模型?
我懂了,Kimi 发明了时光机,逆转时空到的开始蒸馏 Fable,Kimi 怎么这么坏啊。。。


