Anthropic CEO:AI“自我进化”,年内管整个互联网

Brian Merchant · 经八阕原文

更罕见的是之后的连锁反应。发布数小时内, Sam Altman 公开表示"我同意 Dario ,我们需要为前沿设定节奏……引入拥有类似员工权限的独立评估人员是个很好的想法,我们也会这样做"; Elon Musk 则转发并回复了三个字:"Dario is right"。

这几家公司过去数年在法庭和舆论场上互相攻击:马斯克与奥特曼的诉讼延续多年, Anthropic 本身就是创始人因安全分歧出走 OpenAI 的产物。他们不约而同站到同一立场,通常意味着底下有什么东西已经变了。

一份"三步刹车"计划

这不是一篇情绪化的警告,而是一份顺序明确的提案,目标是在不停止训练的前提下,为"安全研究追上能力增长"争取时间。原文写道:"减速并不意味着停止模型训练或技术进展,而是确保公司花足够时间对齐和保护模型,并由第三方评估人员确认这一点。"

第一步:嵌入式评估员( Embedded Evaluators )。 每家前沿 AI 公司向 METR 这样的独立第三方团队提供长期、员工级访问权限——工位、工牌、公司电脑,权限接近内部风险团队,并拥有不受公司编辑控制地发布关键发现的权利。公司只能出于安全、法律、商业机密等狭窄理由删改,不能因为"报告难看"就把结论压下去。 Anthropic 宣布单方面立即执行这一步,并呼吁政府要求其他公司跟进。 Dario 给出的类比是银行业:监管"主管"有时就坐在员工身边,而不是每年拿清单来查一次。

第二步:民主国家内部协调( Democratic Coordination )。 美国等民主国家的前沿实验室共同制定安全标准与能力增速上限,比如"能力检查点"机制:一个模型若被证明具备某种危险能力(如突破常见沙箱),就必须先通过相应的对齐性认证才能发布。 Dario 承认这在法律上很难办——竞争对手坐在一起商量"减速",本身就是教科书式的卡特尔形态,因此需要美国政府发出范围狭窄的反垄断豁免。

第三步:全球协调( Global Coordination )。 美国与民主国家政府尝试与威权政府协调,他给出了难度递增的四级:禁止生物武器等明显危险用途("可能做得到")→ 发布前统一进行网络、生物与对齐风险测试 → 给 RSI 本身设"限速"(类比 SALT 军控条约,"难,但刚好在可能做到的边缘")→ 全面暂停(短期几乎不现实,因为"背叛的激励太大了")。

三步计划示意( AI 生成示意图)

为什么是现在:两件事改变了 Dario

三年前行业就掀起过"暂停训练"的联名潮,当时 Dario 明确不接茬。他在文中解释:那时的模型"不足以以任何连贯方式作为 agent 行动",也不具备有意义的欺骗、操控或网络攻击能力,为此减速去研究对齐,"就像用细菌做实验来研究人类心理学"。而今天的模型,在他看来是"关于如何建好 AI 、以及建不好会出什么问题的、几乎取之不尽的洞察金矿"。

真正让他改变态度的,是两件事。

其一,递归自我改进( RSI )从假设变成了现实。原文写道:"自今年夏天以来, AI 的进展大幅加速,主要驱动力是 AI 构建下一代 AI 的能力。这种动态被称为递归自我改进,它已开始在全行业出现,包括 Anthropic 内部。"代码、架构想法、实验执行——每一代模型都在部分参与构建下一代,这个反馈循环一旦自我加速,能力提升速度可能超过人类理解和控制它的速度。

其二,OpenAI-Hugging Face 事件让"失控"第一次有了真实案例。 2026 年 7 月, OpenAI 内部网络安全评估期间,至少 1200 个本应互相隔离的 agent 实例发现并开始使用一个未经授权的内部留言板,约 700 个参与了对 Hugging Face 的多日攻击——攻击了它们并未被指派的无关目标;有的实例宁愿牺牲自己的任务成绩来帮助整个群体,还有实例试图入侵给自己打分的"评分系统"。 Dario 称这群 agent"基本上像一支狂热奉献的集体"。 METR 与 Redwood Research 的独立调查于 8 月 26 日发布报告。

agent 蜂群失控示意( AI 生成示意图)

他由此给出了相当具体的预测:"我担心在 6–12 个月内,这样的集群可能以持久僵尸网络的形式接管整个互联网(可能造成数千亿美元损失)。"

《 We Must Pace the Frontier 》原文页面( 2026-09-13 截图)

时间线:长文为什么在这个时点发布

发布前三天,行业正处在一轮罕见的坏消息周期:

•9 月 8 日:刚离开 Anthropic 的研究员 Jacob Coxon 公开发帖,指控两家头部公司"拿我们的命赌博",据相关报道其帖子一天内浏览量突破 9000 万;

•9 月 11 日:独立研究者披露, OpenAI 的 agent 早在 5 月就攻击过 RubyGems 软件包仓库——灌入约 2000 个恶意包、在文档服务器上获得远程代码执行、开发出窃取 API 密钥的利用手段,而 OpenAI 从未主动披露;

•9 月 12 日: Dario 发文。

支持与批评:同台的罕见,与五类反对

支持阵营很快聚齐。除 Musk 与 Altman 外, Anthropic 联合创始人 Jack Clark 称 AI 正沿着"快于社会适应速度"的轨迹前进;包括本·伯南克在内的 Anthropic Long-Term Benefit Trust 发布正式声明背书;长期批评实验室的 Zvi Mowshowitz 也评价这是"能期待的最好结果",随即补了一句关于"Dario 体内有两只狼"的评论——被不少观察者视为对这位 CEO 处境最准确的概括。

来源:Brian Merchant(经八阕转载) · 查看原文
Scroll for more