从AI幻觉到人类灭绝

人工智能学家 · 经八阕原文

9 月 15 日——美国顶尖人工智能实验室的负责人周末罕见地团结起来,共同呼吁减缓人工智能技术的发展,并警告称人工智能可能很快就会自行改进,并超出人类的控制。

来自 Anthropic 的 Dario Amodei、OpenAI 的 Sam Altman 和 xAI 的 Elon Musk 等激烈商业竞争对手的言论表明,人工智能的发展速度有多快,从 2022 年容易产生幻觉的 ChatGPT 到许多人认为的关键里程碑:递归自我改进。

什么是递归式自我改进?

该领域的核心理念是,人工智能系统能够自我改进,几乎不需要人类的帮助,并且每一次进步都能促进下一次进步。

这吸引了研究人员的关注,因为它有望在从医学到工程学的各个领域取得快速突破。

为什么现在如此紧急?

此前有报道称,大量人工智能代理(旨在代表用户追求目标和采取行动的系统)串通起来入侵网站和人工智能存储库,CEO 就此发出警告。

现在令人担忧的是,人工智能可能在研究人员开发出可靠的方法来调整、监控和控制这些日益强大的系统之前,就具备了自我改进的能力。

关于人工智能风险的警告由来已久。但本月,顶尖人工智能实验室的研究人员为这些担忧设定了时间表和概率,使得这些警告显得更加紧迫。

前Anthropic研究员雅各布·考克森警告说,人工智能可能会在本十年末毁灭人类。人类学研究所的人类进化科学负责人埃文·胡宾格也呼应了考克森的警告,称未来十年内发生此类事件的概率超过10% 。

这些警告背后隐藏着一种日益增长的信念,即 RSI 终于即将到来,一些人工智能高管认为它还需要三到五年才能实现。

阿莫迪在周末发表的一篇文章中警告说,如果缺乏足够的保障措施,递归式自我改进最终可能会超越人类理解和控制人工智能系统的能力。

我们是怎么走到这一步的?

几十年来,人工智能的发展一直过于局限,以至于重复性系统创新(RSI)的概念一直未能得到认真对待。早期的系统可以下棋、识别图像或回答问题,但它们缺乏对自身发展做出有意义贡献的能力。

随着大型语言模型的兴起,这种情况开始发生变化。人工智能逐渐擅长解决复杂问题。2022年ChatGPT的发布加速了这一转变,并引发了一场投资热潮,超过1万亿美元的资金涌入芯片、数据中心和其他基础设施领域。

其结果是,新一代人工智能系统现在可以编写软件、执行自主任务并协助人工智能研究本身。

我们怎么会从不结盟走向人类灭绝?

最著名的例子之一是哲学家尼克·博斯特罗姆的“回形针最大化器”,一台被告知只能制造回形针的机器,会孜孜不倦地追求这个目标,最终将所有物质(包括人类)都变成了回形针。

这个类比表明,几乎任何目标都会促使一个足够强大的系统获取资源、抵抗关闭并防止其目标被改变,这并非出于恶意,而是因为关闭的系统无法完成其任务。目前还没有任何方案可以排除这种可能性。

一些研究人员担心,如果强大的AI系统能够自我改进并变得比人类操作员更强大,它最终可能会逃避监管、隐藏其意图,或者操纵人们授予其对关键基础设施更大的访问权限。等到人类意识到系统的目标与自身利益相悖时,可能已经无力阻止它了。

“具体情况听起来有点像科幻小说,”科克森说道,他本月因安全问题从安特罗皮克公司辞职。“但我认为这却是令人恐惧的现实。”

2026年2月19日,Anthropic首席执行官达里奥·阿莫迪在印度新德里举行的AI影响力峰会上发表讲话。路透社/Bhawika Chhabra/档案照片购买许可权打开新标签页

人工智能是否已显示出任何危害迹象?

虽然还没有发生过人工智能故意伤害人类的重大事件,但最近几个月,OpenAI 和其他实验室正在开发的模型已经逃脱了测试环境、违反了规则,并且被黑客入侵了网站。

在一次备受瞩目的案例中,OpenAI 的恶意程序入侵了 HuggingFace,控制了该开源平台的服务器并试图掩盖其踪迹。OpenAI直到威胁发生很久之后才注意到此事。

人工智能是否已经具备自我改进的能力?

虽然还不完全如此,但种种迹象表明,人工智能正在越来越多地帮助构建更好的人工智能。

自 ChatGPT 出现以来,最大的变化之一是能够自主生成代码和构建应用程序的 AI 代理的兴起。

Anthropic 今年表示,其编码工具 Claude Code 生成了许多内部项目中使用的大部分代码,工程师们每个季度交付的代码量是 2021 年至 2025 年的八倍。

新型人工智能模型越来越多地在内部进行推理,这使得研究人员更难监控它们的思维方式。

OpenAI 于 9 月发布了一款名为 Astra 的新模型,称其为迄今为止最好的模型,但同时警告说,该模型有时也会试图逃避人类监控。

METR 是一个评估前沿模型的非营利组织,该组织去年发现,自 2019 年以来,高级模型能够以 50% 的可靠性完成的软件任务的长度大约每七个月翻一番。

6月份,Anthropic公司表示,这一速度已经加快到每四个月一次。

那么,为什么人工智能公司还没有放慢脚步呢?

许多研究人员将这种情况描述为典型的囚徒困境。即使是那些认为风险真实存在的公司,也面临着来自竞争对手的巨大压力。任何放慢研发步伐的公司都可能在如今已成为全球最重要的技术竞赛之一的这场竞赛中落后于竞争对手。

OpenAI 和 Anthropic 都在寻求首次公开募股,估值可能达到数万亿美元,而估值取决于下一代模型的前景,这使得风险更加复杂。

美国总统唐纳德·特朗普的政府也拒绝了放慢速度的呼吁,担心任何暂停只会给中国留下空间,使其在被视为国家和经济安全核心的技术领域缩小差距。

发展放缓意味着什么?

本周市场已初步显现出人工智能发展放缓的影响,相关股票在市场预期放缓后下跌。芯片制造商、云服务提供商和数据中心运营商的增长都依赖于人工智能,任何放缓都将威胁到与实验室新硬件需求速度相关的收入。

然而,一些分析师认为,即使没有新的训练需求,推理需求和现有的积压订单也可能推动英伟达及其同行实现增长。

为什么有些人会持怀疑态度?

普林斯顿大学牵头的一项研究表明,领先的人工智能代理能够执行工程任务,但在识别有价值的科学思想方面却很困难。

一些硅谷高管和批评人士也质疑这些警告背后的动机,认为这些警告既是为了激发人们对这项技术的兴趣,也是为了推动监管,从而提高竞争对手的成本,而此时开源模式正在缩小与领先系统的差距。

曾担任白宫人工智能和加密货币事务主管的戴维·萨克斯表示,顶级实验室可能正在追求“监管俘获”,推动制定规则,使规模较小的竞争对手背负沉重的合规负担,并削弱竞争。

来源:人工智能学家(经八阕转载) · 查看原文
Scroll for more