一般一般,全球第三南风窗
言出即行——7月27日晚,中国人工智能初创企业月之暗面,如约开放最新旗舰模型Kimi K3的模型权重、详尽的技术报告、模型架构和关键Infra(基础设施层)技术等。
中国模型又一次“开源”,看似平常,实则突破了常规。
K3是全球首个“3万亿参数”级别的开放权重模型,在多个领域任务上,性能逼齐或超过“美国双巨头”OpenAI和Anthropic的前沿模型。此前,国内模型开源的惯例,是在同一天内上线模型并开放权重,但这一次,开放权重晚于上线时间整整10天。
从中不难窥见,K3开放权重的意义及战略考量,已是今非昔比。
K3开源背景的另一特殊之处,是刚好踩上美国AI行业“大论战”的节点。
7月下旬,有消息称,美国政府正在考虑“重新推动”对中国开源模型的限制措施。但是,从数百家美国企业组成的“小科技联盟”到硅谷巨头,均上书“反对限制开放权重模型”,纷纷签署联名信以壮声势。
7月27日,由英伟达主导的“开放安全 AI 联盟”(OSAA),一共37家创始成员亮相
英伟达创始人黄仁勋,为此专门注册了社媒账号,发文力挺联名信的诉求。谷歌、OpenAI在几小时的观望之后,纷纷“补票上车”,而“头最铁”的Anthropic,是少数至今没有签名的知名科技公司。
虽然硅谷正在“内讧”,但Kimi K3一样“领受”了中国前沿的开源模型在美国的“固定待遇”——Anthropic和OpenAI再次出声,指责 K3的能力,是蒸馏了他们的先进模型、“窃取”了数据得来的。Anthropic甚至在公开信中说,开源模型很危险。
只不过,对这套“老掉牙”且无凭据的指控, AI业界和舆论场都已经“无感”。“双巨头”的指控“陈旧、重复,缺乏创新”,事实上也没起到任何作用。而中国模型的架构创新与性能进步,那是实打实的。
开源模型已经攻入“双巨头”的技术护城河,从深度求索DeepSeek V4到智谱GLM-5.2,再到月之暗面Kimi K3,通过软件工程的方法,一步步补上过往因算力不足导致的短板,现在能够直面前沿封闭模型并“掰手腕”。
图源:视觉中国
因此,K3真正的意义,不只是对“开源、追求性价比”等既有路线的延续,它直接动摇了维持至目前的AI格局及商业模式。
这也是为什么,硅谷看似有“联名信”的共识,但争吵仍在继续;美国政府斟酌已久,却不见一个政策的影子。简单地说,它们曾经依赖的技术路径、商业模式和产业政策,现在,连它们自己都不敢相信了。
AI的竞逐由此进入下一阶段。
“一般一般,全球第三”
要理解K3模型的影响力,就不得不回到K3技术文档,看看月之暗面的研究人员做了什么——别真信了美国“双巨头”所说的“蒸馏”就能做出一个前沿模型。
普通人看模型能力,最常参考的是评测得分。这时,模型就像一个参加高考的学生,不同基准测试是不同的学科,考完再算出总分,排出状元、榜眼、探花……
正是K3的突出“成绩”,才在美国掀起了如此大的波澜。
我们只看几门“优势学科”。根据技术报告,K3“编程能力”尤其突出,在真实命令行环境里完成软件开发等任务,能力与GPT-5.6 Sol基本接近;在“搜索和工具使用”方面,这可以简单理解为模型上网“冲浪”的能力,K3高于GPT-5.6 Sol和Claude Fable 5。
“前端与网页开发”方面,Arena.ai的WebDev榜单显示,截至7月26日,K3在综合排名中暂列第一。
Arena前端代码竞技场1679分,Kimi K3位列第一
以上列出的三门“学科”,可以近似地理解为人类考试的“数理化”,难度高、商业变现的潜力大。考得高分的K3自然“前途无量”。
作为一个开源模型,K3还能够被客户下载、调优,低成本使用。这就不难理解,为什么“双巨头”被集体看衰。
不过,K3技术文档明确表示,“综合表现仍落后于目前最强大的专有模型 Claude Fable 5 和 GPT-5.6 Sol”。
文档接着写道,根据评测,K3持续领先于其他接受评测的开放模型和专有模型。
如果沿用“考生”的比喻,K3的表现,就像是一名优等生被问到考得如何时,谦虚而又不失优雅地说,“哎呀,一般一般,全球第三”。
Kimi K3在整套评测中展现出前沿水平的能力/Kimi官网截图
这些能力从何而来?
K3的技术报告,重点突出了三件事:一是,在预训练阶段继续扩大模型规模;二是,通过架构和工程创新,提高每一份算力转化为模型能力的效率;三是,在后训练阶段,针对编程、搜索和智能体等任务进行强化学习。
不涉及复杂的技术细节,我们只需要知道,这三件事都与中国大模型面临的“算力墙”有关。
因为美国的芯片限制,中国AI公司无法获得英伟达最先进的芯片及大规模算力供应,主要问题就是如何用有限的算力,“压榨”出更多智能。
于是,对大模型的基础架构Transformer进行“大刀阔斧”的改造,成了一条突围之路。
各厂商旗舰模型参数规模演变,Kimi K3以2.8T登顶开源阵营/Kimi官网截图
但这不是Kimi能够一手包办的。
从DeepSeek V3开始,中国团队“重做”Transformer中沿用多年的“基础零件”,智谱、MiniMax、月之暗面等公司接力这个过程,从MLA、DSA到KDA等,把混合专家模型推向极致稀疏。
这些技术虽然晦涩,但它们的目的是一致的:节省算力开销。
因此,我们可以按这个思路,理解K3做了哪些工作。


