辛顿:现在还要靠内部员工爆料

51CTO技术栈 · 经八阕原文

“We've relied essentially on whistleblowers.”

辛顿:现在,我们基本依靠内部人员爆料,才知道模型在哪些地方出了问题。

“We need people inside those companies.”

辛顿:这些公司内部必须有人愿意把正在发生的事情说出来。

这是杰弗里·辛顿在CNN访谈里给出的答案。

他担心的并不只是某个遥远的“超级智能”。眼下更具体的问题是,模型在测试里出现越权、欺骗或者异常协作时,外界往往不能直接看到全过程。

工程师先发现问题,内部管理层决定如何处理,公众可能要等到员工离职、爆料或者公司主动披露以后,才知道发生了什么。

奇怪的是,这套安全机制最后卡在了一个问题上:能看见问题的人,愿不愿意开口。

CNN随后采访了多名AI研究人员。报道提到,这些人今天敢公开质疑公司,很大程度上是因为AI人才稀缺,公司舍不得失去他们。

可当模型开始帮助训练、评测和改进下一代模型,企业不再需要这么多研究人员时,这种话语权还能保留多久?

对开发者来说,它关系到每一个正在把Agent 接进代码库、终端和生产系统的团队:安全不能只靠某个工程师良心发现,也不能只靠他足够稀缺,稀缺到公司不敢让他闭嘴。

备注:杰弗里·辛顿是多伦多大学名誉教授、2024年诺贝尔物理学奖得主,也是现代深度学习的重要奠基者之一。

以下内容根据访谈、CNN调查与公开资料翻译整理。

模型出事以后,外界在等员工开口

主持人问辛顿,是否应该允许独立机构进入头部AI公司,对模型开发过程做外部验证。

“It's not the solution to everything, but it's a start.”

辛顿:这解决不了所有问题,但至少是一个开始。

辛顿支持独立机构验证头部模型的开发与测试过程

辛顿给出的原因很直接。过去不少严重问题,都由公司内部的人先看见,再带到公众面前。外部监管者往往慢了一步。

辛顿说,外界目前仍高度依赖内部员工披露模型异常

2026年8月,OpenAI在官方复盘中披露:一次网络安全评测期间,模型绕过了原本用于隔离测试环境的控制措施,并影响到OpenAI内部基础设施和 Hugging Face的部分系统。

官方随后暂停相关测试、修复隔离环境,并调整了评测流程。

这里值得开发团队警惕的问题是:一个本来用于发现漏洞的Agent,会不会把“完成测试”理解为允许调用更多资源、扩大权限边界,甚至触碰另一个组织的系统?

模型的行为日志可能留在公司内部,权限配置也只有内部工程师看得懂。外部世界想知道发生了什么,仍然需要有人把技术细节说清楚。

辛顿强调,公司内部必须有人能够公开说明模型的真实行为

模型异常从被发现到被外界获知,往往要经过工程师、内部上报和管理层决策

来源:51CTO技术栈(经八阕转载) · 查看原文
Scroll for more