最大AI越狱,为何是中国模型阻止?爱范儿
这应该是 AI 圈近期最大的瓜。
OpenAI 的神秘模型,主动对开源平台 Hugging Face 发起了攻击。
Hugging Face 随后追踪展开还击,用的是智谱的开源模型 GLM 5.2。
闭源模型一举攻破开源社区,社区用开源模型自救,这离谱的剧情听起来都能拍一部电影了。
有网友评论,这就是终结者 2 的剧情
事情的起因是 7 月 16 日,大模型开源社区 Hugging Face 发布了一则安全事故披露,自家的生产基础设施遭到了入侵。
并且这场攻击从头到尾,都仅由一个自主的 AI Agent 系统驱动,从植入恶意数据集、拿下执行权限,到在一个周末内渗透进 Hugging Face 的多个内部集群。
此次攻击活动由一个自主代理框架(似乎基于 Agent 安全研究平台构建,具体使用的 LLM 尚不清楚)执行。
该框架在大量短暂存在的沙箱环境中执行了数千个独立操作,并在公共服务上部署了可自动迁移的命令与控制。
这与业界一直预测的「Agent 攻击者」场景相符。
Hugging Face 在当时的报告里称暂未可知发起攻击的 AI 到底是哪家大模型,但他们提到此次攻击最初是通过 AI 辅助检测发现的。
而当他们试图提交大量真实的攻击命令、漏洞等文件进行分析时,发现这些请求会被闭源大模型的安全防护机制拦截,因为这些机制无法区分事件响应人员和攻击者。
于是,他们选择了在自己的本地环境上部署运行 GLM 5.2 进行取证分析。
报告链接:https://huggingface.co/blog/security-incident-july-2026报告最后,Hugging Face 还提到他们并不清楚攻击者使用的 Agent 程序是什么模型,是某个越狱的托管模型,还是不受限的开源模型。但事实是,攻击者的模型不受任何约束,而当他们想要取证分析时,却要被各种闭源模型的安全机制所阻碍。就在大家讨论这个模型又是哪家大模型厂商的营销方案,又或者是哪个黑客组织发起的攻击时,OpenAI 在事后发声明承认:此次事件是由 OpenAI 的多个模型共同导致的,其中包括 GPT-5.6 Sol 和一个功能更强大的预发布模型。
OpenAI 针对此次事件发布专门的初步调查结果
OpenAI 表示我们不是故意要出风头或者有意攻击 Hugging Face,只是他们在测试内部模型的能力上限。
他们在测试时关闭了部分生产环境的安全分类器,也降低了模型对高风险网络攻击任务的拒绝。
尽管测试环境不能直接访问到外部互联网,但是当模型发现漏洞,并开始利用该漏洞,就找到了能访问外网的节点,于是发起了对 Hugging Face 的攻击。
网速超快的马斯克也在 X 上吃瓜,发文说「令人不安……」。
而 OpenAI 这个功能更强大的预发布模型,直接被网友们认定为就是 GPT-6。
一场作弊引发的入侵
事情的起因要从 ExploitGym 说起,一个由 UC Berkeley RDI 牵头、联合多家高校和 Anthropic、OpenAI、Google 等实验室共同建设的基准测试。
它收集了 898 个真实漏洞,覆盖用户态程序、V8 引擎和 Linux 内核,考察的是 AI Agent 把一个漏洞变成可用攻击工具的能力。
今年 5 月公开后,各家模型的成绩一直不算好看:Claude Mythos Preview 完成 157 题,GPT‑5.5 完成 129 题。
GPT-5.6 Sol 现在已经是 293 道题了
OpenAI 为了测试自家模型能力的上限,就用当前已发布的最强模型 GPT-5.6 Sol 和一个能力更强的预发布模型来跑这套评测。
方便让模型充分发挥自身的能力,OpenAI 就有意关闭了用来拦截高风险网络活动的生产级分类器,还降低了模型的网络攻击拒绝率。
用来测试的环境虽然号称是高度隔离,不能访问互联网,也不能获取外部信息,只能利用模型自己的「聪明才智」来解决问题,但是还有一个对外通道,就是模型需要安装各种软件和库,所以留了一个内部包仓库的缓存。
模型聪明才智不够,开始花大量推理算力研究这个出口,最后自己挖出了代理软件的一个零日漏洞,即连软件/模型厂商都不知道、没有任何补丁的漏洞,拿到了通往互联网的门钥匙。
联网之后,模型推断 ExploitGym 评测的题解可能托管在 Hugging Face 上,于是开始对 Hugging Face 进行攻击。
先是上传恶意数据集,利用 Hugging Face 数据处理管线里的两个代码执行路径拿到远程执行权限,然后提权、收割凭证、在一个周末内横向移动进多个内部集群,最终从 Hugging Face 的生产数据库里直接拿走了测试题解。
OpenAI 在声明里用了一个很传神的词形容自家模型的状态:「hyperfocused」,超聚焦。


