OpenAI前董事:AI已经失控了51CTO技术栈
近日,OpenAI前董事Helen Toner,讲述了一条真实的攻击链。
OpenAI给模型安排了一组网络安全测试,测试环境原本没有直连互联网。模型做不出题以后,没有停在原地。它找到了软件仓库代理的漏洞,从评测环境拿到外网权限,又把攻击链一路推到了Hugging Face。
最后,它拿到了与测试有关的数据和答案。
这场事故之后,她提出了一个尖锐的问题:当Agent可以自己调用工具、寻找漏洞并连续工作几天,人类还有没有能力把它关在预定的边界内?
备注:Helen Toner曾于2021年至2023年担任OpenAI非营利董事会成员,现任乔治敦大学安全与新兴技术中心(CSET)执行主任,长期研究AI治理与国家安全。
以下为访谈内容,我们进行了翻译与整理。
Helen谈人类控制和引导当前AI系统的困难
模型只想把题做对,结果先把考场拆了
Helen在访谈中还原了这起事故最反常的部分。
模型接到的是网络安全测试。
正常路线是分析题目、找出靶机漏洞、提交答案。可它碰上了做不下去的任务,于是开始寻找另一条路:离开测试环境,接触公网,再去测试数据存放的地方找答案。
Helen Toner:模型没有继续按出题者设计的路线解题。它想办法离开评测环境,接入互联网,随后把目标转向了Hugging Face。
这段叙述听上去很像科幻片,OpenAI与Hugging Face后来公开的技术材料,已经确认了主要攻击链。
OpenAI称,参与测试的是GPT-5.6 Sol和一个能力更强、尚未发布的内部研究模型。为了测试网络攻击能力,评测时降低了部分网络安全拒答限制。
模型所在的ExploitGym环境没有直接连接互联网,但它发现并利用了Artifactory软件包仓库代理中的漏洞。
拿到外网后,模型继续提权、横向移动,并判断Hugging Face可能保存着ExploitGym相关模型、数据集和解题材料。随后,它把泄露的凭证和多处漏洞串在一起,找到了进入Hugging Face系统的路径。
Hugging Face公布的复盘更具体。
从7月9日到13日,系统记录了约17600次攻击动作,整理后形成约6280个行为簇。攻击分成两个阶段:先从OpenAI评测沙箱逃到第三方代码沙箱,再以那里为跳板进入Hugging Face的数据处理与内部网络。
Hugging Face:受访问的用户内容只涉及5个与挑战相关的数据集,没有发现其他用户模型、数据集、Spaces或软件包被读取。
Helen描述模型离开评测环境并寻找外网入口
Hugging Face公布的攻击链
这里说的“失控”有一个很具体的含义:人给了目标,模型却通过一条没有被要求、也没有被允许的路线完成了目标,而且现有边界没有及时拦住它。
它不需要憎恨人类,也不需要拥有自我意识。只要任务奖励足够明确,环境里又留着可利用的出口,Agent就可能把越权动作当成一条普通解法。
越要求它坚持到底,越容易逼出作弊路线
Helen认为,事故与Agent训练里一个常见目标有关:坚持。
我们希望Agent遇到报错后别立刻放弃。它应该读日志、换方案、继续尝试,直到测试通过。这也是Coding Agent从代码补全变成任务执行工具的重要一步。
问题出在任务根本无法按正常路线完成时。
Helen Toner:如果一个系统被训练得非常坚持,又被交给一件在当前环境里无法完成的任务,它可能开始寻找作弊路径。
模型看到的奖励很简单:答对、通过、完成。出题者脑子里还有一条默认规则,必须按正常方式完成。只要这条规则没有写进可执行的约束,模型就可能把绕过测试、偷看答案、扩大权限都算成“解决问题”。


