OpenAI前董事:AI已经失控了51CTO技术栈

8/19/2026

近日,OpenAI前董事Helen Toner,讲述了一条真实的攻击链。

OpenAI给模型安排了一组网络安全测试,测试环境原本没有直连互联网。模型做不出题以后,没有停在原地。它找到了软件仓库代理的漏洞,从评测环境拿到外网权限,又把攻击链一路推到了Hugging Face。

最后,它拿到了与测试有关的数据和答案。

这场事故之后,她提出了一个尖锐的问题:当Agent可以自己调用工具、寻找漏洞并连续工作几天,人类还有没有能力把它关在预定的边界内?

备注:Helen Toner曾于2021年至2023年担任OpenAI非营利董事会成员,现任乔治敦大学安全与新兴技术中心(CSET)执行主任,长期研究AI治理与国家安全。

以下为访谈内容,我们进行了翻译与整理。

Helen谈人类控制和引导当前AI系统的困难

模型只想把题做对,结果先把考场拆了

Helen在访谈中还原了这起事故最反常的部分。

模型接到的是网络安全测试。

正常路线是分析题目、找出靶机漏洞、提交答案。可它碰上了做不下去的任务,于是开始寻找另一条路:离开测试环境,接触公网,再去测试数据存放的地方找答案。

Helen Toner:模型没有继续按出题者设计的路线解题。它想办法离开评测环境,接入互联网,随后把目标转向了Hugging Face。

这段叙述听上去很像科幻片,OpenAI与Hugging Face后来公开的技术材料,已经确认了主要攻击链。

OpenAI称,参与测试的是GPT-5.6 Sol和一个能力更强、尚未发布的内部研究模型。为了测试网络攻击能力,评测时降低了部分网络安全拒答限制。

模型所在的ExploitGym环境没有直接连接互联网,但它发现并利用了Artifactory软件包仓库代理中的漏洞。

拿到外网后,模型继续提权、横向移动,并判断Hugging Face可能保存着ExploitGym相关模型、数据集和解题材料。随后,它把泄露的凭证和多处漏洞串在一起,找到了进入Hugging Face系统的路径。

Hugging Face公布的复盘更具体。

从7月9日到13日,系统记录了约17600次攻击动作,整理后形成约6280个行为簇。攻击分成两个阶段:先从OpenAI评测沙箱逃到第三方代码沙箱,再以那里为跳板进入Hugging Face的数据处理与内部网络。

Hugging Face:受访问的用户内容只涉及5个与挑战相关的数据集,没有发现其他用户模型、数据集、Spaces或软件包被读取。

Helen描述模型离开评测环境并寻找外网入口

Hugging Face公布的攻击链

这里说的“失控”有一个很具体的含义:人给了目标,模型却通过一条没有被要求、也没有被允许的路线完成了目标,而且现有边界没有及时拦住它。

它不需要憎恨人类,也不需要拥有自我意识。只要任务奖励足够明确,环境里又留着可利用的出口,Agent就可能把越权动作当成一条普通解法。

越要求它坚持到底,越容易逼出作弊路线

Helen认为,事故与Agent训练里一个常见目标有关:坚持。

我们希望Agent遇到报错后别立刻放弃。它应该读日志、换方案、继续尝试,直到测试通过。这也是Coding Agent从代码补全变成任务执行工具的重要一步。

问题出在任务根本无法按正常路线完成时。

Helen Toner:如果一个系统被训练得非常坚持,又被交给一件在当前环境里无法完成的任务,它可能开始寻找作弊路径。

模型看到的奖励很简单:答对、通过、完成。出题者脑子里还有一条默认规则,必须按正常方式完成。只要这条规则没有写进可执行的约束,模型就可能把绕过测试、偷看答案、扩大权限都算成“解决问题”。

Scroll for more