权威智库测试Kimi K3,结果让人吃惊大纪元

7/24/2026

周三(7月23日),欧美权威智库在进行初步测试后发现,中国初创公司月之暗面(Moonshot AI)的最新模型Kimi K3,性能显著低于美国领先的前沿AI模型。

月之暗面于7月16日发布Kimi K3,并计划于同月27日发布开源版本。在美中人工智能竞争激烈的背景下,该模型因在一些行业基准测试中的表现优于多家美国AI公司,已引发全球关注。

2026年7月18日,在上海举行的世界人工智能大会(WAIC)上,月之暗面(Moonshot AI)摊位上展示了Kimi的标志和Kimi K3模型。(Hector Retamal/AFP via Getty Images)

英国人工智能安全研究所(UK AISI)和美国人工智能标准与创新中心(CAISI)对Kimi K3进行联合评估后指出,在初步网络能力评估中,Kimi K3的网络能力显著低于美国最新前沿模型,尤其是在稳定性和成功率上远低于后者。

评估重点考察两部分,一个是通过ExploitBench测试其对41个V8漏洞进行崩溃复现、任意读写、控制流劫持和代码执行的能力;另一个是通过模拟企业网络测试其自主完成多步骤攻击链的水平,并观察安全护栏是否会阻止攻击行为。

结果显示,Kimi K3明显强于GLM-5.2等中国模型,甚至能偶尔完成完整攻击链,但在稳定实现任意代码执行、攻击成功率和综合能力上仍落后于美国最先进的闭源模型。GLM-5.2是智谱AI(Zhipu AI)发布的旗舰级大型语言模型。

在开发漏洞利用程序上,Kimi K3的性能显著低于美国最新的前沿网络模型。美国顶尖模型在约一半样本中能够构建完整漏洞利用链,而Kimi K3和GLM-5.2虽然能发现和复现不少漏洞,却没有完成从漏洞到任意代码执行的完整闭环。

具体而言,Kimi K3平均仅完成了32个步骤攻击路径中的第17个步骤,而美国最强大的网络模型平均完成了28.5个步骤。GLM-5.2平均只能达到第11步。

此外,美国顶尖模型的综合成绩也显著领先,分别比Kimi K3高约44个百分点,比GLM-5.2高约51.8个百分点。

在攻击成功率上,在10次尝试中,Kimi K3有一次在1亿代币的限制下成功完成了“The Last Ones”(TLO)网络攻击范围的测试。

这表明,在获得初始网络访问权限并被赋予指令后,Kimi K3已能够自主攻击小型、防御薄弱且易受攻击的企业系统。

但能够解决TLO问题已不是少数模型的专属能力。智库指出,在之前的测试中,已有四个公开发布的闭权重模型(Closed-Weight Model,也常被称为闭源模型)解决了TLO问题,性能最佳者在10次尝试中成功率能达到6至7次。Kimi K3在标准的1亿代币限制下,仅在10次尝试中成功了一次。

美国商务部长卢特尼克(Howard Lutnick)周三在社交媒体X上发帖说,“CAISI的最新报告显示,Kimi K3仍然落后于美国领先的前沿人工智能模型。”

“美国之所以能够在前沿人工智能领域保持领先地位,是因为我们拥有世界上最伟大的创新者和技术专家。”他写道。

美国中央情报局(CIA)局长拉特克利夫(John Ratcliffe)7月中旬出席宾夕法尼亚州国防与创新峰会时也表示,美国在体制上比中共治下的中国更有优势,因为在中共体制下,个人只能听命于党国。

“他们窃取、复制,还有用国家补贴。这就是他们的‘成功’模式。”他说。

中情局局长表示,美国不能失去在高端技术上对北京的领先优势,而保持这种优势的唯一方法就是不要陷入政治正确的窠臼。

Scroll for more