AI“斯普特尼克时刻”:Kimi K3震动硅谷华尔街日报
随着月之暗面(Moonshot AI)发布拥有 2.8 万亿参数的开源模型 Kimi K3,硅谷迎来了 AI 领域的“斯普特尼克时刻”。
在最新一期《Moonshots》访谈中,Peter Diamandis、Emad Mostaque(前 Stability AI 联合创始人)等五位科技领袖深入探讨了 Kimi K3 打破传统闭源双头垄断的行业震动,指出大模型演进已进入“前沿制造业”阶段,并预测在硬件适配、软件优化与极端量化(如三元量化、亚比特量化)的推动下,未来几个月内 AI 推理成本将迎来 10 至 50 倍的爆发式下降,最终加速高阶智能在私有化部署与端侧设备上的全面普及。
AI“斯普特尼克时刻”降临:AI 实验室月之暗面(Moonshot AI)发布拥有 2.8 万亿参数(2.8 Trillion)的开源权重模型 Kimi K3,在前端代码竞技场(Front-end Code Arena)力压 Claude Fable 5 登顶第一,打破了硅谷此前由 OpenAI 与 Anthropic 主导的前沿模型双头垄断。
“造模型就像精密制造业”:Kimi K3 依然基于标准的 Transformer 架构,其成功在于极致的数据精炼与工程制造能力。开源社区已证明,通过内核优化与数据清理,能够以传统成本 1% 的资金逼近顶尖前沿模型性能。
推理成本将暴跌 10 至 50 倍:前 Stability AI 联合创始人 Emad Mostaque 表示,K3 目前每百万 Token 售价约 15 美元,但随着模型针对下一代硬件的适配以及开源推理服务商的极限优化,未来几个月内其推理成本还将迎来 10 到 50 倍的下行空间。
端侧智能与极端量化革命:随着三元量化(Ternary,1.58 bit)、二进制量化(Binary)及亚比特量化(Sub-one bit)技术的突破,到明年底,具备 K3 级别智能的模型将能够直接在 16GB 内存的手机或车载端侧设备上离线运行。
前沿智能变为“易耗品”:前沿 AI 的“保鲜期”缩短至数周,企业评估模型的速度已跟不上迭代速度。未来的核心资产将从单一依赖闭源 API,转向可自由切分、微调开源模型的“架构接口层”。
Kimi K3横空出世:2.8万亿参数打破硅谷双头垄断
日前,AI 实验室月之暗面(Moonshot AI)突然发布了新一代前沿模型 Kimi K3,给硅谷及美国前沿实验室带来了如同“四倍浓缩咖啡”般的震撼。
Kimi K3 拥有高达 2.8 万亿参数(2.8 Trillion Parameters),在性能上实现跨越式突破:不仅在前端代码竞技场(Front-end Code Arena)击败了 Claude Fable 5 斩获全球第一,还在品牌营销、设计、数据分析、消费品模拟及内容创作等 6 大领域登顶。更令行业震动的是,该模型的完整权重定于 7 月 27 日全面开源,意味着全球任何企业与开发者均可免费下载并在本地(On-Prem)部署。
Alex Wieser-Gross 在分析人工智能指数(Artificial Analysis)的最新帕累托前沿图(Pareto Frontier)时指出:
“此前,前沿 AI 领域基本上被 OpenAI 和 Anthropic 双头垄断。而现在,随着 Meta、SpaceX AI 的加入以及中国 Moonshot 跻身帕累托最优前沿的第三名,前沿 AI 竞争已全面演变为自由混战。这对于希望通过开源模型掌握自身数据主权的企业而言,是巨大的福音。”
“做模型就像精密制造业”:用1%的相对成本逼近前沿
面对 Kimi K3 的性能跃升,美国前沿实验室不得不面对一个严峻的问题:如果不用打破 Transformer 框架,就能达到逼近 GPT-5.5 Max 的水平,美国实验室每年烧掉的数十亿美元到底花在了哪里?
Alex Wieser-Gross 补充道,K3 的已公开架构并没有“黑魔法”,本质上依然是标准的 Transformer,结合了专家混合(MoE)与线性化注意力(Linearized Attention)等成熟技术的精妙组合。
前 Stability AI 联合创始人 Emad Mostaque 提出了一个极其深刻的视角:
“打造顶尖模型,本质上是前沿制造业。他们极其清楚原材料(数据)与制造流程,并在现有的硬件约束下将工程化与易用性发挥到了极致。”
针对训练成本,Dave Blundin 举例说明,GitHub 上的开源加速项目(如 Keller Jordan speedrun)此前已成功将 GPT-2 级别的训练成本削减了 99%。而 Kimi K3 的出现,正式验证了这些软件栈优化、内核重构与数据去糙取精(如使用 Muon 优化器剔除无用 Token)的思路在前沿超级大模型规模下完全成立。
极端量化与端侧智能:推理成本还将暴跌10至50倍
在谈及 AI 的商业化落地与成本曲线时,Emad Mostaque 给出了极其乐观的预测。
目前,Kimi K3 的每百万 Token 调用成本约为 15 美元,虽高于普通开源模型,但考虑到其在本土芯片上运行且已具备极高利润率,未来的下行空间极为惊人:
“一旦将 K3 这种模型部署在下一代芯片或专用光子芯片上,并经过全行业的极限优化,未来几个月内,其推理成本将再降 10 至 50 倍(乃至百倍)。”
与此同时,端侧智能(Edge AI) 正迎来量化技术的暴风雨。
Prism ML 发布的 Bonsai 27B:作为首个在智能手机本地完整运行的 270 亿参数模型,通过三元量化(Ternary,1.58 bit),将模型体积压缩至 6GB(精度仅损失 5%),在完全离线状态下赋予手机 110-120 IQ 的智能。
三星与腾讯的极度量化:三星最新的 Nano Quant 已经突破了“每权重 1 个比特”的界限(Sub-one bit);腾讯团队则实现了 3000 亿参数模型的二进制压缩(Binary Compression)。
Emad Mostaque 强调:
“到明年年底,一个仅需 16GB 内存的普通设备,就能运行达到今天 Kimi K3 级别的模型。这意味着世界上每一辆汽车、每一个机器人、每一台智能设备都将拥有内置的持久智能,可以在边缘侧进行自主决策。”
前沿智能变成“易耗品”:企业资产重估与开源大势
随着模型发布频率从过去的每 60 天缩短至每 10 天,甚至即将在明年初实现“日更”,前沿智能的商业形态发生了根本性转变。
OpenExO 创始人 Salim Ismail 提出:
“前沿智能(Frontier Intelligence)现在变成了一项完全易过期的资产,其保鲜期只有区区几周。任何企业如果要经过层层审批、内部开会来评估是否部署某款模型,等评估完成时,该模型在技术上已经落后了三代。”
这一趋势对企业资产定价与科技巨头估值带来了深刻重塑:
基础模型厂商估值承压:如果企业可以直接免费在本地运行性能媲美顶级闭源模型的开源权重,闭源 API 服务的溢价空间将被大幅压缩。
应用与架构层成为最大受益者:知名投资者 Gavin Baker 指出,除了基础模型厂商外,几乎所有的实体企业、软件公司与传统行业都是 AI 成本暴跌的巨大受益者。未来的核心竞争壁垒在于能否将模型灵活无缝嵌入自身业务流程的“架构接口层(Interfaces)”。
以下为访谈全文,由AI辅助翻译:
Peter Diamandis: 今天我们发出了紧急信号,召开这场紧急播客,因为美国刚刚经历了 AI 领域的“斯普特尼克时刻”。Kimi K3 于昨天发布,以有史以来最大的开放模型震惊了整个 AI 界,并直接登顶第一。
Emad Mostaque: 这个星期他们不仅缩小了差距,而且直接翻过了篱笆。Kimi 一直是一个感觉有点不一样的模型,这就是为什么它一直在写作基准测试中名列前茅。例如 K3 实际上是一个多模态模型,因此它可以接收各种输入并做出理解,这也是它在前端领域如此出色的原因之一。
Alex: 现在美方是 Meta 和 SpaceX AI 之间的自由竞争,而中国和 Moonshot(月之暗面)则成为了帕累托最优前沿上的第三名。前沿智能现在成了一项完全易过期的资产。
Peter Diamandis: 美国的前沿实验室把钱都花到哪里去了?
Salim Ismail: 在互联网世界我们一直有这个信念,即信息渴望自由,基本上智能也渴望自由。
Peter Diamandis: 我们现在需要的是某种全球性的……现在,那可真是个月球采样(Moonshot),女士们先生们。
Peter Diamandis: 欢迎来到《Moonshots》,所有人!全网关于 AI 与指数级技术第一的播客,您通往即将到来的奇点的前排座席——也许我应该说,通往现在的奇点、通往当下的奇点、通往持续的奇点。今天我将……今天我们发出了紧急信号并召集了紧急播客,因为美国刚刚经历了 AI 的斯普特尼克时刻,不过稍后会详细介绍。请允许我欢迎我优秀的 Moonshot 伙伴们,今天我们五人组全员到齐:Alex Wieser-Gross、Dave Blundin、Salim 和 Emad Mostaque。我是你们的主持人兼丰盈倡导者 Peter Diamandis。如果奇点的速度让你头晕目眩,很好,我的也是,而这正是重点。我们 Moonshots 的使命就是让您随时了解最新动态、跟上正在发生的事情,最重要的是,在非凡的变革速度与即将到来的丰盈时代中保持乐观。各位,欢迎,感谢大家大老早起床,或者对 Emad 来说是在下午。
Emad Mostaque: 我今天早上 4 点就起来了,时差的好处,不过我确实还能再睡一小时。
Salim Ismail: 欧洲午睡时间。
Emad Mostaque: 对,这之后我还安排了健身。
Peter Diamandis: 很多事情正在发生,各位,非常感谢大家的时间。在开始之前,我想亲自向我们所有的订阅者和观众说声谢谢。我不知大家最近有没有机会看看和阅读 YouTube 的聊天记录,我能说的就是我们也非常爱你们。我们的使命是传递新闻,我们花了难以置信的时间进行审查。 Salim、Alex 和 Emad,我今天早上收到了你们的短信,“添加这个,添加那个”,有太多事情在发生。我也必须说,所有 Alex 解释 JSpace 的梗图都很棒,所以继续制作 Alex 的梗图吧。
Alex: 看看你们能不能搞懂我的 JSpace。
Peter Diamandis: 能看到里面的读数。在评论区也看到了很多对你的喜爱,有一些非常棒的人。难以置信的是,大多数 YouTube 视频 newspapers 都是喷子狂欢,而我们的完全相反,真的非常棒,向你致敬,Peter。不,我只是再次表达绝对的感激,感谢大家抽出时间听播客。我们团队和所有 Moonshot 伙伴花了大量时间评估发生了什么并呈现出来。如果您还没有订阅并开启通知,请开启。
Salim Ismail: 我只想说明,如果我们做足够多的这种紧急播客,在某些时刻它就会变成 Moonshots 每日播客。
Peter Diamandis: 或者是持续播客。我依然觉得大家一起搬进 Airbnb 然后打开摄像头,这早晚会发生。
Peter Diamandis: 好了,让我们切入第一个故事,这是个大新闻。我们刚刚经历了一个 AI 的斯普特尼克时刻,就像给美国的极前沿实验室注射了四倍浓缩咖啡一样。Kimi K3 于昨天发布,以有史以来最大的开放模型震惊了 AI 界,并直接登上第一名。这里有一些背景:Kimi 来自中国实验室 Moonshot AI(月之暗面)。在过去一年里,他们攀登排行榜,推出了 K2、K2.6、K2.7,每一个都在缩小与 Anthropic 和 OpenAI 的差距。这周他们不仅缩小了差距,而且一夜之间跨过了篱笆。他们发布了 Kimi K3,这是一个拥有 2.8 万亿参数的怪兽。他们完全绕过了计算墙,K3 比之前的 Kimi 模型跳升了 17 个名次,超越了 Claude Fable 5,在前端代码竞技场(Front-end Code Arena)斩获第一。K3 在其他 6 个领域也排名第一:品牌与营销、基于参考的设计、数据分析、消费品、模拟和内容创作。完整的模型权重定于 7 月 27 日左右发布,这意味着地球上的任何人都可以下载并在自己的本地(On-Prem)运行。各位,这有多重要?Alex?
Alex: 我认为这对竞争非常有好处。首先作为一个初步事项,我想指出一些在报道和对 K3 的狂热中不太明显的事情。第一,正如 Moonshot 指出的,他们声称在过去 12 个月中的 9 个月中,Kimi 模型系列保持着开源权重模型中的 SOTA(最高水平)。如果这个说法属实,那么在过去一年里基本上一直都是 Kimi。第二,看看已发布的架构,因为我们还没有看到开源权重,但承诺在月底发布,里面并没有什么魔法,这非常引人注目。人们可以想象在 Anthropic 或 OpenAI 的幕后,Sam Altman 继续在暗示幕后有一些后 Transformer 架构实现了所有这些性能突破。但看看已发布的 K3 架构,没有魔法,它本质上仍然是 Transformer。他们显然做出了一些创新,但在他们如何做专家混合(MoE)、如何线性化注意力方面是大家熟知的创新,他们有自己特殊的 Kimi 品牌的线性化注意力,但它本质上仍然是一个可识别的 Transformer。一个可识别的类 Transformer 架构可以在任务成本前沿上几乎匹配 GPT 5.5 Max,我认为这相当惊人。这就提出了一个问题:如果只需使用 Transformer 就能达到如此接近的水平,美国的前沿实验室把钱都花在哪了?如果它已经处于成本前沿,并且整体 AI 性能排在第三位,美国实验室到底把所有的钱都花在什么地方了?所以至少知道 Transformer 架构依然宝刀未老,我感到莫大的安慰。Emad,听听你的分析,因为你一直在追踪这个。
Emad Mostaque: Kimi 一直在各种基准测试中名列前茅,他们自一年多前发起以来就定期推出中国最大的开放权重模型。正如 Alex 所说,架构并没有什么特别新颖的地方,有一些改进,比如他们与 UCLA 等机构做的 Muon 缩放,他们一直在发布所有这些部件的线索。我认为这里的关键是底层数据。Kimi 的模型感觉一直有点不一样,这就是为什么它在写作基准测试中总是第一。他们在这里做的事情似乎非常非凡:GLM 出来时是个极好的模型,但仅限文本;而 K3 实际上是一个多模态模型,因此它可以有各种输入并做出理解,这也是它在前端如此出色的原因之一,尽管我们没料到它在前端代码上力压所有人登顶。这涉及我之前说过的话:构建优秀稳固的模型是前沿制造业。虽然会有算法改进等各种东西出现,但为什么中国电动车比福特更好?这感觉是同一回事。这是工程学,但也像上个月英国销量第一的车型 Jaiku J7,满配出来只要 5 万左右,只有三分之一的价格。这感觉非常相似,他们知道原材料成分,现在以一种对消费者极其友好方式呈现,并正在用他们现有的资源无情地执行制造过程。因为看架构内部,他们仍然在使用 H800,在 Nvidia 芯片上落后了几代,但他们通过静态形状等手段充分利用了华为和阿里的下一代芯片,在工程和易用性上不断推进,这就是为什么前端代码异军突起的原因。他们只是在想“如何做出最惊人的输出”,从个人网站到游戏;而美国实验室可能在看其他方向,专注于不同的事情。


