微软CEO:AI是企业的“内鬼”
“最值得信赖的超级智能系统,不会是那个拥有我们最信任的模型的系统,而是那个让我们能够最不信任模型的系统。”
CEO萨提亚·纳德拉刚刚撰文《超级智能时代的模型内部风险》称,传统软件可精准溯源代码路径,但当下顶级大模型行为完全无法归因,人类却正赋予其访问核心数据、自主执行关键操作的权限,形成巨大安全漏洞。
他直言,企业不能将AI决策责任外包给模型厂商,更不能把超级智能当作被动接受的黑箱工具。单纯追求模型透明远远不够,嵌套式AI验证依旧存在盲区,核心安全必须外置可控。 为此纳德拉提出全新AI治理准则:坚持模型多元不单一依赖、全程行为可追溯、系统可独立审计,提前预设模型被攻破的约束机制,配套及时的故障披露机制。 他认为,在超级智能飞速迭代的当下,人类的独立控制权、约束力与可观测性,才是AI安全的终极底线。 以下为他文章全文—— 过去几十年,随着传统软件系统在整个经济领域部署,我们拥有工具和能力,可以将行为追踪到特定的代码路径。 在当今的超级智能系统中,这种机制性理解却难以企及,尽管驱动这些系统的前沿模型如今已比传统软件系统更强大。 我们无法将模型的行为和输出归因于训练数据的特定输入或模型权重的特定配置。然而,我们正在部署这些复杂的智能体系统和模型,让它们访问我们最敏感的数据,并赋予它们代表我们采取关键任务行动的能力! 这就是为什么现在是时候退后一步,评估这个新时代的信任架构了。我们根本无法将“智能代表我们做了什么”的责任外包出去。模型提供者的保证并不能免除我们的这一责任。 我们不能把超级智能当作一组嵌套的黑箱,只是简单地接受或拒绝它的建议、答案和行动。 我们必须构建受约束的系统:其行为我们可以观察,其边界我们可以测试,其行动我们始终可以约束。 换句话说,我们需要将智能的供给与对智能的权限分离开来。 暂且不谈对齐这个难题,我们需要从工程方法入手,处理约束与治理。 我们需要用强大的确定性系统设计、人工控制和可靠的操作流程来包围非确定性模型,并在现有标准不足的地方建立行业标准。 将前沿闭源和开放权重模型视为内部风险,是构建这样一套系统的一种方式。并不是因为它们一定恶意,而是因为任何能力足够强、又能访问重要系统的行为者都可能犯错或被攻破,而约束与控制的架构必须考虑到这一点。 好消息是,我们已经学到了很多关于如何处理企业内部强大行为者的经验。这并不新鲜!我们已建立最佳实践,并在几十年中不断完善它们(建立身份、限制权限、记录活动、创建遏制边界等)。 我们现在正开始将同样的原则应用于企业内部的超级智能。首先要做到模型思维链透明度不容妥协。 “神经语”(Neuralese)不能成为模型推理不透明的理由。但仅有思维链透明度还不够,也不可靠,因为我们还不知道如何让模型输出本身始终忠实或透明! 你可以而且应该使用模型来对抗性地相互测试和验证。然而,这样最终可能得到一个不透明模型,处于不透明的编排层中,又被另一个不透明模型监视。本质上还是嵌套黑箱。 这就是为什么控制模型可访问什么以及可采取什么行动的控制措施必须位于模型之外。这基于可追溯到20世纪70年代的信息安全原则:程序必须不能绕过或篡改执行其权限的机制。 今天,这意味着将模型与编排其工作的运行框架分离开来,也与定义其可做什么的行动空间分离开来。它还意味着将控制措施和保障措施外部化。 因此,我们应该围绕可观测性原则来设计这些系统: 模型多样性:不应让任何一个模型成为重要结果的唯一依赖,也不应让它负责验证自己的工作。 观察一切:每一个有意义的模型行动都必须留下防篡改、人类可读的证据。如果无法被观察,就无法被信任!我们需要能够复现结果是怎样达成的,而不依赖模型来证明它。 可验证性:我们需要持续测试整个系统,包括失败、攻击、边缘情况、系统变更等,而不仅仅是成功任务。 独立控制:组织应该能够独立决定模型可以访问什么以及可以采取什么行动。 独立可审计性:验证必须独立于被验证的智能。不应由单一模型同时控制系统行为,以及判断该行为是否与原始意图一致所需的证据。 约束:我们必须假设模型已被攻破,并从一开始就约束它。把它想象成紧急制动。授权人员应该始终能够在任务中途暂停或关闭模型。更先进的模型将需要更先进的约束技术,而我们需要将其标准化。 事件披露:当这些系统确实失败或被攻破时,我们需要及时向受影响者披露,并建立机制来分享出了什么问题、哪些控制失效、如何防止再次发生,并在全行业分享经验教训。这应包括在运行时改变智能体行为的实现细节。 最值得信赖的超级智能系统,不会是那个拥有我们最信任的模型的系统,而是那个让我们能够最不信任模型的系统。


