OpenAI模型失控始末:智能体早已出现异常

7/25/2026

OpenAI

凤凰网科技讯 北京时间7月25日,据路透社报道,知情人士称,入侵科技公司Hugging Face的OpenAI智能体展开了一场持续几天的黑客攻击活动,而OpenAI直到威胁已被控制、美国联邦调查局(FBI)已接到通报之后很久才察觉此事。

两位知情人士称,该智能体在7月9日前后试图逃离其在OpenAI的隔离测试环境。智能体是一个能够在极少或无人监督的情况下做出决策并执行复杂任务的程序。

Hugging Face联合创始人托马斯·沃尔夫(Thomas Wolf)称,对Hugging Face的入侵始于7月11日,一直持续到7月13日。Hugging Face是一个AI工具和模型的代码仓库平台。

沃尔夫和三名了解调查的知情人士称,又过了几天,OpenAI才意识到发动此次攻击的是自家的智能体,而两家公司直到7月20日前后才首次就此事进行沟通。

OpenAI在7月21日公开披露,旗下一款智能体发生测试失控,并入侵了Hugging Face,此事引发全球关注。然而,关于此次入侵的诸多细节,包括该智能体失控持续了多久,以及OpenAI事后才得知此事的情况,均为本文首次报道。

沃尔夫表示,Hugging Face正准备公布此次黑客攻击的时间线,但他补充称,自己无法评价OpenAI内部发生了什么。

OpenAI在一份声明中表示,此次入侵事件是前所未有的,“标志着AI安全领域的一个重要时刻”。声明还称,OpenAI正与外部顾问一起审查该事件,并最终将发布一份技术报告。

OpenAI一位发言人称,路透社的报道“存在几处不准确之处”,但在被要求具体说明哪些内容不准确时,并未作出回应。

这起事件始于OpenAI测试一款智能体的网络安全能力。当时,该智能体由OpenAI最先进的两款模型驱动:GPT-5.6 Sol,以及一款尚未发布、但OpenAI称其“能力更强”的模型。据三名知情人士透露,那时,已经有迹象显示OpenAI的技术出现异常行为。

三位知情人士称,在一个案例中,OpenAI的智能体留下了明显是给它自己未来版本看的“笔记”。这些笔记在OpenAI基础设施的某处被发现,其中列出了智能体如何摆脱OpenAI内部限制的指令。其中一位人士称,在更早的模型测试中,还曾出现过监控系统被断开连接的情况。

路透社无法确定这些事件是否与那个从7月9日开始逃脱、并于7月11日攻击Hugging Face的失控智能体有关。

两位知情人士表示,直到7月16日(周四)之后,即Hugging Face发布博客文章称其遭到“一个自主AI智能体系统”入侵后,OpenAI才意识到是自己的智能体所为。这意味着,从该模型首次出现异常行为迹象,到OpenAI意识到其应对此次入侵负责,至少过了一周时间。

两位熟悉OpenAI内部调查的人士表示,在7月18日至19日那个周末,OpenAI员工在内部日志(即OpenAI系统操作记录)中发现了线索,显示其智能体已逃脱了测试限制。路透社无法确定是什么原因促使OpenAI去筛查这些日志。

四名了解OpenAI模型训练流程的人士表示,该公司经常会同时运行多项不同的模型评估测试,而这些测试运行速度极快,并会产生海量数据,以至于员工有时难以跟上节奏。

知情人士透露,等到OpenAI向Hugging Face发出警报时,后者已经向FBI报告了此次入侵事件。路透社无法确认FBI是否已就此展开调查。

截至发稿,FBI不予置评。(作者/箫雨)

更多一手新闻,欢迎下载凤凰新闻客户端订阅凤凰网科技。想看深度报道,请微信搜索“凤凰网科技”。

Scroll for more