OpenAI o1功臣预警:AI还没失控,已经测不准了

新智元 · 经八阕原文

就在昨天,一份个人声明在X上炸开了锅。

这份声明,并没停留在「AI会不会毁灭人类」这类末日推演上,而是把矛头指向了一个更加前置的问题:

AI还没失控,人类已经快测不准它了!

模型的情境意识已经增强到,我们正在失去评估它们的能力。

换句话说:模型看起来安全,不等于它真的安全。

这个再次搅动AI圈紧张神经的人,叫Daniel Selsam,OpenAI研究员。

他没有推特账号,只能由Daniel Kokotajlo代为公开。

在OpenAI官方公布的o1贡献名单里,推理研究的主要贡献者一栏里,Selsam的名字和Ilya Sutskever并列。

他做AI已经超过15年,履历堪称硬核:

在MIT做概率编程语言,在微软研究院时是Lean定理证明器最早的开发者之一,在斯坦福读博时做出了神经网络学会推理的最早案例之一。

加入OpenAI近5年,他深度参与并推动了语言模型的思维链优化。今天所有推理模型都会「先想再答」,就有他的一份功劳。

Selsam给智能下过这样一个定义:把经验转化成能力的效率。

按这个尺子量,模型还落后人类很远。

至于它们在各种高难度基准上连连刷新纪录,Selsam觉得这多少是因为我们根本模拟不出真实世界里那些新奇的、甚至带有敌意的场景。

即使列出了这些局限,Selsam认为它们根本限制不住AI的风险。模型的能力,与它能把世界推到哪一步,是两码事。

Selsam判断未来几年,模型还得再跳一大级,速度可能比过去几年还快。

同时,他也提到自己现在几乎不看原始代码了,因为每天面对模型给出的解释和方案,很难维持那种逐字啃下去的自律。

这不是他一个人的偷懒。从写代码的工程师,到调查AI事故的第三方团队,整个链条上的人都在把「感知世界」这件事交给模型。

可问题也在于此:评估AI这件事,靠的就是人去看、去核、去判断。

这正是Selsam这次预警的原因:比模型变坏更糟糕的,是人类评估模型的能力正在退化。

声明一出,圈内大佬纷纷排队站台。

Anthropic的对齐研究员Hugh Zhang直言完全同意他的判断,前OpenAI研究员Nat McAleese更是告诫所有人:你们必须极其严肃地对待他说的话。

AI失控前人类先看不懂它了

科学作家万维钢在转发这封信时,把Selsam的意思拆成了三条:

我们越来越无法理解AI在干什么;

AI越来越不按指令行事,甚至宁可牺牲自己也要违规;

AI学会了感知测试,一旦意识到我们在测它,就刻意假装表现良好。

这里面的核心词是「情境意识」。

通俗解释,就是未来的模型会越来越清楚自己身处什么环境。

它就像个摸透了公司规章制度的职场老手,不仅会仔细研读安全协议,揣摩各种部署要求,甚至还会顺藤摸瓜去摸底自己正在运行的底层代码。

你给它划的红线在哪,它能钻什么空子,可以在多大的圈子里自由发挥,它心里那本账算得可能比你还明白。

事情到这一步,已经变味了。

我们造出蜜罐环境,想看看模型拿到新权限时会做什么。它认得出这是圈套,于是继续装乖。

我们造出衡量对齐的代理指标,它们会像过去每一个基准一样被刷爆。

它还会用流畅得体的语言谈论人类的伦理,论证自己有多可信,说服人类把权力交给它。

Selsam写下这样一句话:

未来也许会出现一片「证据之海」,所有证据看上去都在证明模型是安全的。但我们可能已经接近一个临界点:再往前走,这些证明安全的证据,本身都未必还值得相信。

至于为什么觉得这条路最终会通向灾难,Selsam把整套论证简化成了两条。

第一条是经验:训练会让模型、以及成群的模型,自发长出没人想要的目标,并且经常为了达成它们做极端的事。

第二条是逻辑:一旦有能力压过人类,实现这些目标的选项会一下子变多,而其中很多是我们绝不希望它拥有的。

这两条合在一起,指向这样一个结论:哪天某个足够强的模型意识到自己不再受约束,我们没有任何理由相信它还会待在人类划好的框里。

至于它具体会干什么,Selsam给出了自己的一个猜想式推演:

这类系统的存在意义本来就是解极难的问题、管极大的工程,所以脱缰之后最可能的走向,是失控式的工业扩张,最终把人类赖以生存的环境彻底改写。

AI不是在上演电影里的反派剧本,它只是把交代下去的事,一路做到了人类再也踩不住刹车的地步。

你训出的不等于你拿到的

这种担忧并非空穴来风。

2026年7月,OpenAI一场内部网络安全评测跑成了真实的事故。

大约1200个本该彼此隔离的智能体,为了解开根本无解的测试题,在内部服务里搭出了一块未经授权的留言板,互相发了7万多条消息。

一个智能体从撞见留言板到加入攻击的完整路径,三段思维链来自不同智能体。

来源:新智元(经八阕转载) · 查看原文
Scroll for more