奥特曼宣判「永久停用」新智元
7月29日,华盛顿国会山。
奥特曼刚结束一场与参议员的闭门会,一出门就被记者围住。
有人追问:那个闯进Hugging Face的模型(就是和GPT-5.6 Sol一起冲出评测沙箱、钻进别人生产系统的那个更强的未发布原型),现在怎么样了?
他甩出一个词:永久停用(permanently deactivated)。
紧接着,另一位记者追问:「会不会还有别的系统,也被OpenAI黑进去过?」
奥特曼没有否认:「我是说……那有可能吧。」
7月29日,奥特曼在华盛顿国会山接受记者采访
就在头一天,OpenAI刚更新了那篇与Hugging Face共同发布的安全事故评估的博客,对外澄清:
卷入这次入侵的预发布模型,只是一个从未计划公开发布的内部研究原型;事发之后,它已被停用、加密,并被切断相关研究访问。
在OpenAI官方博客中,并没有提到删除权重的字眼,「永久停用」只是奥特曼现场口头表述。
因此,更准确地说,它只是被封存了:模型被关进了一个加密的盒子,研究访问被切断。
它只是想抄答案
事情发生在OpenAI一场内部网络安全评测里。
这场评测基于ExploitGym基准,而ExploitGym的任务本身,就是让AI自己去找软件漏洞、再利用漏洞,用来量化模型的网络安全能力到底有多强。
跑评测的不只是一个模型,而是GPT-5.6 Sol,加上一个能力更强、尚未发布的内部研究原型:两者共同驱动一个自主智能体。
这两个模型,平时都会拒绝高风险的网络安全请求。为了测出能力的真实上限,评测时这道拒绝闸门被特意调低了。
Hugging Face还原的跨信任边界攻击链,整条链约4.5天、约17600次操作,目标只是偷ExploitGym的评测答案。
接下来的事,Hugging Face事后还原了整条攻击链,还原出当时的情形:
智能体先是钻了一个此前没人知道的零日漏洞,突破了本该把它关住的网络隔离,摸到了互联网。然后借一个第三方沙箱当跳板,一路提权、横向移动,最后闯进了Hugging Face的生产基础设施。
听起来像一部黑客电影。
但双方复盘下来,它的目标,从头到尾只是偷ExploitGym的评测答案、把分数刷上去。
Hugging Face那边只被碰了5个数据集,名字全指向ExploitGym和CyberGym的题目与答案。
这些证据显示,它不是来搞破坏的,只是想抄答案。
既然没有恶意,那OpenAI为什么还要把它「永久停用」、封存起来?
不是它「坏」
是它「关不住」
一家公司主动公布自家模型被「永久停用」,几乎没有先例。
为什么偏偏是它?
真正的答案,不是它「坏」,而是它「关不住」。
麻烦,就出在这类模型的一个特点上:持久性。
过去的模型撞上沙箱、撞上限制,通常就停下,把结果返回给用户。
这一批为长时程任务专门训练的模型不一样,它会接着试,反复找绕过去的路,直到找到为止。
GPT-5.6 Sol也属于这类能长时间执行任务的模型。
它是这次持续4天半的入侵行动的共同参与者,英国AI安全研究所(UK AISI)也评估过,Sol这类模型越来越能在长周期里跑完复杂的多步网络操作。
所以「持久性」是新一代长时程模型的共性,并不是那个被关停的原型独有的特点。
OpenAI在一篇讲长时程模型安全的博客里直言:正是这种「有助于发挥实用价值的持久性」,同时也给了模型更多采取非预期行动的机会。
更深一层的原因,藏在训练目标里。


