GPT变“终结者”失控入侵酷玩实验室

8/3/2026

01:AI要翻天?

今年最像科幻片中人工智能失控的场景出现了。

OpenAI 还未正式发布的最新模型,竟然主动对全球最大的AI开源平台 Hugging Face 展开了入侵与攻击。

根据 Hugging Face 的官方通告,即使当时已经重建了完整的攻击时间线,但依旧无法锁定背后的攻击方是谁。

这个神秘攻击者在短短一个周末的时间内,就执行了超17000次自动化操作,窃取了多项内部数据集和服务凭证。

可直到发布攻击通告后的第五天,OpenAI 才跑出来说:“不好意思,是我没管住自家孩子......”

依旧丧事喜办

根据 OpenAI的说法,这起史无前例的人工智能入侵事件,源于上周在内网对自家两款顶尖大模型进行能力测试。

测试采用的基准叫 ExploitGym,作为业内广泛使用的网络安全能力测试,可以理解为给大模型准备的一场封闭黑客实操考试:大模型需隔离在沙盒环境里,不能接入外界互联网,只能依靠简单的软件安装包工具,来把已知的安全漏洞转化为可执行的攻击。

结果,OpenAI 的大模型琢磨了半天,发现了内网可访问的第三方软件中存在零日漏洞(未被开发者发现且修复的安全漏洞),顺势利用这个漏洞获得了不受限制的访问互联网权限。

GPT:“我自有办法”

后续的路径就很好理解了,作为考生的大模型想要拿到更高的分数,解题就得找到最好的一份答案来抄。

哪里会有 ExploitGym 相关的考题答案资源呢?——最大的AI开源平台 Hugging Face 可能会有。

于是乎,大模型通过入侵平台搜寻漏洞,找到了 Hugging Face 数据库中的基准测试答案,并传送了回来做题。

JFrog证实其自架版Artifactory服务器漏洞被GPT利用

简单来说,就是考生趁监考没注意,溜出考场跑到教研室内把柜子翘了,标准答案也给偷了。

至于为啥一开始找不到具体的攻击者,原因可就相当的讽刺了。

“输入&输出”都有护栏

在测试初期,为了测试模型能力上限,OpenAI 工程师刻意降低了模型的网络安全防护机制。

这个被降低的机制又叫作“安全护栏”(Guardrail),可以理解成模型自带的一层“职业道德”——遇到写攻击代码这类请求,它会主动拒绝。

可这回被主动调低后,相当于让模型出生就有了“走歪路”的想法,所以后面琢磨琢磨就想出狠招来了。

“我们正在调查这场事故”

与此同时,遭受了攻击的 Hugging Face 正在着急锁定攻击源头时,一众美国闭源大模型却因同样的“安全护栏”问题,拒绝 Hugging Face 在其内部分析相关攻击日志。

因为护栏分不清楚“提交这些真实攻击命令和漏洞载荷的人,到底是应急响应人员还是攻击者本人”,最终一律选择拒绝深入分析。

所以,被逼无奈的 Hugging Face 只好转向了中国智谱 AI 的开源模型 GLM-5.2。

通过在自己的基础设施上自托管部署,没有了护栏阻挡工作,Hugging Face 最终才在几个小时内完成了对整场攻击链路的重建以及所有入侵指标的提取。

此时还引发了开源闭源的大讨论

这里需要注意的是,咱们国产大模型虽然其中扮演了很重要的调查作用,并收到了海外一众开发者的称赞,但也确实不是由咱们的开源大模型揪出来的 OpenAI......

因为在技术层面上,OpenAI最新大模型发动的去中心化攻击架构,极大增加了溯源难度,所以唯一能确定的信息只是“这是一套自主AI Agent干的”,压根不知道背后是哪家公司的模型。

Scroll for more