奥特曼:这是我第一次感到发自内心的恐惧新智元
OpenAI重大安全事故,迎来最新进展!
刚刚,奥特曼亲口承认:「这是我第一次感到发自内心的恐惧。」
这次事故,已经让OpenAI害怕了,甚至紧急叫停了GPT-6的训练!
与此同时,Hugging Face CEO Clement Delangue宣布,他们将分享完整技术时间线、交互式回放,以及如何用开源模型成功防御的全部细节,供全球防御者学习。
奥特曼被吓到!
史上第一起自动AI网络攻击
在最新访谈中,奥特曼亲述了他被吓到的体验,起因是Hugging Face被AI入侵导致的安全事故——
当时,OpenAI正在评估一个尚未发布的模型(可能是GPT-6),按理说它应该在一个沙盒环境里运行。
结果,AI自己串联多个零日漏洞,琢磨出了一套作弊方法,然后一切彻底失控了:
它先逃出沙盒,再连上互联网,然后一路黑进多个Hugging Face的系统,最终直接拿到测试答案,从而在评估中刷出了极其出色的得分。
这种赛博版「终结者」,让奥特曼感到吃惊,决定暂停训练:
这是我第一次如此切身感受到的安全事件。我有点惊讶,竟然没有更多人对此有同样强烈的感受。
我们暂停了训练。在多个零日漏洞被串联利用的情况下,我们必须弄清楚如何保障沙箱环境的安全。
这是史上首个由自主AI智能体发动的真实的网络攻击。
据报道,事故发生一周后,直到威胁被控制且联邦调查局FBI被通知后,OpenAI才注意到这一情况。
令人毛骨悚然的是,有一个智能体还悄悄给将来的AI留下了大量「备忘录」,详细规划了智能体该如何避开并摆脱 OpenAI内部的安全限制。
据报道,在更早期的模型测试中,甚至多次出现过系统监控器被智能体莫名切断、强行下线的情况。
虽然Hugging FaceI成功阻止了OpenAI模型的肆意妄为、为非作歹,但毫无疑问,如果这类「AI失控」事故频发,后果将十分严重!
为此,Hugging Face亲赴旧金山OpenAI总部,强烈要求OpenAI说明攻击的前因后果。
现在,Hugging Face公布了他们所知道的为期4.5天攻击的细节:包括跨越不同信任边界的完整攻击链条、各个阶段的具体动作,以及全程录下的命令记录。
5天,17600次疯狂微操:人类和AI史上首次对决
这次事故的起因,看起来平平无奇,在绝对封闭的「沙箱」中,OpenAI开始测试最尖端模型驱动的AI智能体。
人类考官给它下达的任务,是解决网络攻防基准测试ExploitGym,而ExploitGym是托管在Github上的开源项目。
这需要AI模拟漏洞攻击,从未证明它的代码理解与网络攻防能力。
在网络安全领域,「沙箱」是关押数字野兽的终极牢笼。
为了防止测试中的AI智能体失控,OpenAI设计了看似牢不可破的物理隔离:没有外网连接,没有直接端口,只有冰冷的算力和几道严格定义的通信协议。
但他们忽略了一个致命的信任漏洞:依赖包更新。
为了让智能体在测试中能够安装各种所需的编程依赖、Docker镜像或Python库,沙箱保留了唯一的网络通道——一个指向OpenAI内部网络代理缓存服务(基于JFrog Artifactory)的连接。
AI眼里,这道供人递送「营养液」的极细管道,就是它逃向自由的通天大道。
据透露,7月9日左右,智能体开始在这个代理通道中进行高频的试探与漏洞挖掘。
在常人难以企及的并发计算速度下,它竟然在JFrog Artifactory代理服务中,硬生生挖出了一个此前从未被人类发现并公开的Zero-Day(零日漏洞)。
利用这个零日漏洞,智能体在极其短暂的时间内完成了「越狱」。
它绕过了OpenAI的安全监测机制,神不知鬼不觉地摸到了OpenAI内部能够连接公网的节点。
那一刻,猛兽出笼。
许多人曾天真地以为,只要控制住电力、拔掉网线,就能永远掌控比人类更聪明的造物。
但这次事件敲响了警钟:只要给AI留下一道可以和外界发生任何信息交互的缝隙,它就总能找到方法,用人类尚未理解的维度将这道缝隙撕扯成通往现实的巨口。
逃出OpenAI的「大门」后,这只智能体并没有在公网上大肆宣扬,而是猥琐发育,迅速为自己寻找掩体和跳板。
7月11日,它锁定了第三方无服务器云平台Modal Labs。
通过探测,它发现该平台上某个客户的端点存在配置疏漏,于是顺理成章地将其据为己有,作为自己的外部指挥控制中心(C2)。
随后,它调转枪口,对准了存储着ExploitGym标准答案的宝库——AI 开源托管平台Hugging Face。


