Kimi K3开源,3万亿模型权重全球开放新智元

7/27/2026

就在刚刚,全球首个3万亿参数级开源模型Kimi K3正式开源!

Moonshot AI宣布,发布Kimi K3的模型权重、技术报告,并开源支撑Kimi K3模型训练的关键Infra技术:MoonEP、FlashKDA和AgentEnv。

K3不仅是一个参数量高达2.8T的原生多模态MoE巨兽,更是全球首个在长逻辑链编程、超长上下文智能体协作、复杂推理上,能够与目前最强闭源模型(Fable 5和GPT-5.6 Sol)掰手腕的开源模型!

这一里程碑式的工作,不仅展示了中国AI团队在研发上的雄厚实力,更为开源社区带来了真正意义上的前沿级智能。

K3开放权重,开启3万亿参数级开源AI时代

2026年7月27日,Moonshot AI兑现承诺,Kimi K3的完整模型权重正式面向全球开源社区发布。

这标志着,开源大模型正式进入2.8万亿参数的新纪元,Kimi K3也成为全球首个真正落地的3万亿参数级别开源模型。

此次发布的不仅是模型权重,还包括相关技术细节和报告。

Moonshot表示,他们已与多家推理合作伙伴及开源维护者紧密协作,确保K3能在主流硬件和框架中可靠运行。

这意味着——开发者可以下载完整权重进行本地部署或二次开发;研究机构能基于K3探索超大规模MoE、新型注意力机制等前沿课题;企业可构建专属的超长上下文知识系统和智能Agent集群。

开源社区将迎来新一轮的应用浪潮!

参数规模:把天花板又抬高一截

过去一年,Kimi系列几乎每个季度都在刷新开源模型的参数与能力的天花板。

K3的2.8T参数,不仅是目前已知最大的开源模型之一,更是第一个真正跨入「3T 俱乐部」的存在。

相比前代K2,K3在架构上实现了显著突破:

KDA混合线性注意力机制,专为超长序列设计;

Attention Residuals,提升深层模型的训练稳定性;

MoE大幅优化:896个专家,仅激活16个,结合Stable LatentMoE框架,在保持巨量参数的同时极大提高了计算效率。

官方数据显示,这些创新让K3的整体扩展效率较K2提升约2.5倍,真正做到了「规模」与「可用性」的平衡。

与Kimi K2.5的主要区别在于,Kimi K3的视觉编码器MoonViT-V2完全从零开始训练,仅依赖后续token预测,可直接依据语言建模目标调整编码器的表征。

在整个训练过程中,MoonViT-V2保持稳定。

值得指出的是,MoonViT-V2 在视觉评估中的表现与 SigLIP 初始化的基线模型相当。

它支持100万token超长上下文,并原生具备多模态能力。

总之,K3是架构创新与场景适配的综合进化。

官方技术博客强调:「前沿智能属于所有人」。Kimi K3的开源,正是这一理念的最新实践。

根据Moonshot官方及第三方评测,Kimi K3在编程、代码Agent、前端开发、长上下文推理等场景中表现突出。

它的整体智能水平进入全球第一梯队,仅次于少数闭源顶尖模型,在开源阵营中处于领先地位。

Kimi K3技术报告解读

这次和开源消息一起放出的,是一份47页的技术报告。

以下是技术报告的核心内容。

2.8万亿参数的开源「六边形战士」

Kimi K3告诉我们:开源模型同样可以做到极致的 Scaling与Reasoning。

Kimi K3的核心底座数据堪称豪华:

惊人的体量: 总参数量高达 2.88万亿,每个Token激活参数量为 1040亿。

百万级上下文: 原生支持高达 100万 Token 的超长上下文窗口。

原生多模态: 视觉与文本从预训练第一天起就交织在一起,没有任何后期的「缝合」对齐阶段。

推理期思考缩放(Test-Time Scaling): 支持从 Low、High 到 Max 多种Thinking Effort级别,在复杂任务上会像人类一样「三思而后行」。

架构三大革新:扩展效率提升2.5倍

训练一个3万亿参数级别的模型,绝非简单地堆叠GPU。

Kimi K3相比上一代 Kimi K2,在整体扩展效率上实现了约2.5倍的飞跃。

这归功于其极其优雅且暴力的架构设计。

1.混合注意力机制:KDA + Gated MLA

传统的Softmax注意力机制在处理百万级上下文时,KV Cache的内存占用会瞬间撑爆显存。Kimi K3独创性地采用了 混合架构——

Scroll for more