Kimi K3开源,硅谷巨头看傻了智东西
智东西7月28日报道,刚刚,月之暗面发布Kimi K3的模型权重、技术报告,并开源支撑Kimi K3模型训练的关键Infra技术:MoonEP、FlashKDA和AgentEnv。
Hugging Face CEO Clem Delangue发文,Kimi K3 30分钟内以超过4000个赞登顶趋势榜。迄今为止最快的发布增长速度!
此前7月17日,月之暗面发布拥有2.8万亿参数的Kimi K3,随即凭借出色的基准测试和实际体验被不少网友称作“中国的Fable 5时刻”。
Kimi K3开源后,北美AI基础设施创企OsmanticAI的创始人兼CEO Ahmad发文,将Kimi K3称为“本地版Fable 5”,并“强烈建议大家下载体验”,这样“他们永远也夺不走我的Fable 5”了。
数字员工Devin开发主体、美国知名AI创企Cognition宣布,Kimi K3现已接入Devin桌面客户端与命令行工具(CLI),并称:“在FrontierCode 1.1评测基准上,Kimi K3是我们测试过首款性能逼近前沿水准的开源模型。”
Nebius、Baseten、Fireworks等海外AI基础设施厂商随即宣布Day 0适配Kimi K3。Nebius称:“Kimi K3是首个达到前沿性能水平的开放权重模型,是开放模型发展历程中的一大进步。”
华为昇腾CANN宣布对模型MXFP4量化实现Day0原生支持,并提供在昇腾950PR/DT系列和Atlas A3系列集群部署实践。同时,趋境科技宣布,基于开源大模型推理引擎SGLang,完成了Kimi K3在华为昇腾910C超节点上的Day0适配,并同步开源相关适配成果。
网友在Kimi K3上线前的讨论也非常火热。有网友发帖戏称,Hugging Face甚至给Kimi K3做了个预热网页。
截至Kimi K3上线半小时前,已有近3700名开发者在等待上线。且在上线10分钟前,Kimi K3的上线页面还短暂出现过404的情况。
2.8亿参数模型权重全面开放
三大关键Infra技术开源
Kimi K3是一个拥有2.8万亿参数的混合专家(MoE)模型,具备原生视觉理解能力,并支持100万token的上下文窗口。
现在,每个人都可以下载并部署Kimi K3模型。无论是用于内部研发,还是嵌入到面向终端用户的产品中,均可自由使用。
Kimi K3此次还同步开源了训练系统,即Infra基础设施层的三项Infra技术:MoonEP、FlashKDA和AgentEnv。
三项开源Infra技术中,MoonEP是为超大细粒度MoE设计的高性能通信库,让专家并行通信在不均衡情况下仍保持极致效率。
FlashKDA是Kimi Delta Attention的高性能算子,在英伟达H20上prefill速度相比flash-linear-attention基线提升1.72-2.22倍,可直接作为替换后端使用。
AgentEnv是与KVCache.ai合作开发的沙箱系统,为大规模Agent训练提供高保真、强隔离的运行环境,支持快速快照、恢复和分叉,可应对大规模并行的Agent工作流。其中,FlashKDA此前已开源,MoonEP和AgentEnv随本次发布正式开源。
在模型架构方面,KDA+AttnRes以3:1比例混合KDA与Gated MLA,通过块级注意力残差增强跨层信息流动,实现高效长上下文建模。
Stable LatentMoE使每个token从896个路由专家中激活16个,通过SiTU-GLU与Quantile Balancing在极高稀疏度下保持训练稳定。
MoonViT-V2视觉编码器从零开始使用next-token prediction训练,无需对比预训练,在达到基线效果的同时获得更稳定的优化过程。
后训练方面,模型在通用推理、通用Agent和编程Agent三大领域进行大规模任务合成,配合百万token上下文的强化学习基建,并完成了近20个内部评测集的完整评估。
验证编程、Agent与视觉能力全面提升
在官方公布的评测结果中,Kimi K3在编程、Agent任务和视觉理解等多个方向展现出较强能力。
在编程能力方面,Kimi K3在超长时序持续开发SWE Marathon、软件逆向Program Bench、终端运维Terminal Bench 2.1等测试中表现突出。
其中,SWE Marathon、Program Bench均取得第一,Terminal Bench 2.1达到88.3分,与GPT-5.6 Sol接近;在高难度软件工程任务FrontierSWE中,Kimi K3以81.2分位列第二,仅次于Claude Fable 5。
在Agent和知识工作场景中,Kimi K3同样展现出较强的任务执行能力。在网页深度调研BrowseComp、办公自动化Automation Bench、Excel财务建模SpreadsheetBench 2等测试中取得领先,其中BrowseComp达到91.2分,Automation Bench和SpreadsheetBench 2均排名第一。
不过,在综合白领任务GDPval-AA v2、APEX-Agents等更贴近真实办公流程的评测中,Kimi K3仍弱于Claude Fable 5等顶级闭源模型。
在视觉能力方面,Kimi K3在图表理解CharXiv、文档分析OmniDocBench等任务中表现较强,其中OmniDocBench达到91.1分,超过参与对比的多款模型;但在部分视觉推理任务中,Kimi K3仍存在差距,例如零样本视觉工具任务Zerobench低于Claude Fable 5。


