“AI教父”辛顿警告:最危险的阶段可能正在逼近

文学城原文

AI会不会真的杀死所有人类?

这是美国知名记者、播客主持人纳伊玛·拉扎(Nayeema Raza)在最新一期节目里,直接抛给“AI教父”杰弗里·辛顿(Geoffrey Hinton)的问题。

作为诺贝尔物理学奖得主、AI先驱,辛顿从2023年开始公开警告AI风险。如今,他的担忧正在从理论讨论逐渐变成现实。

10月3日,辛顿在社交平台X上转发了一篇由22位AI顶尖研究人员共同署名的论文《如果AI研发自动化引发智能爆炸?》(What if automating AI R&D triggers an intelligence explosion?),这是他首次正式参与递归自我改进(RSI)领域的学术研究。

论文关注的是一个越来越现实的问题:当AI开始参与下一代AI的研发,甚至能够自己提出假设、设计实验、写代码、分析结果并继续改进模型,AI研发速度会不会进入新的加速循环。

论文援引的内部数据已经出现明显变化。Anthropic数据显示,2025年1月,AI生成的获批代码占比还只有个位数,到2026年5月已经超过80%。2026年3月,Claude在仅接受高层次人类监督的情况下,可以自主完成约1%的内部AI研发工作,到8月已经升至26%。如果这种趋势继续下去,论文推演认为,在极端情况下,今天需要一年才能完成的AI技术进步,未来可能只需要大约5周。

拉扎的这场专访,则把论文里的问题进一步拉回现实:如果AI真的进化越来越快,人类该怎么监管?政府还有多少时间?哪些工作会留下来?孩子应该怎样面对AI?如果AI最终比人类聪明,我们还应该让它听从人类吗?

辛顿的回答并不总是悲观。他认为AI很难被真正“叫停”,因为它已经拥有太多有价值的用途,也牵涉巨大的经济利益。真正需要做的,是尽快建立能够约束和引导AI发展的监管机制,同时把更多资源投入AI安全研究。

以下为辛顿最新专访实录,在不改变原意的情况下有所精炼:

01 AI已经开始参与“造AI”

拉扎:你从2023年开始不断提醒人们AI的风险,现在几乎所有头条都在讨论“AI会不会杀死人类”。这种变化对你来说,是一种验证,还是更让人沮丧?

辛顿:挺令人沮丧的,但至少现在人们终于意识到这里存在一个很大的问题。我认为,最近发生的一些事情让公众真正开始重视它,比如OpenAI的智能体攻击Hugging Face事件。

拉扎:你认为普通人有必要真正理解AI是怎么工作的吗?还是说,监管可以交给专家,普通人不需要懂技术?

辛顿:我认为理解它非常重要。我们正在创造一种新的存在,它和人类有很多不同,但在理解世界这件事上又和我们有相似之处。如果我们不知道它到底是什么,就很难真正监管它。我最近写了一本面向非技术读者的书,叫《比AI我们更聪明》(Smarter Than Us),预计明年3月出版。其中一个目的,就是让更多人理解AI是怎么工作的,以及它可能带来什么风险。

拉扎:你最近参加了一场美国国会参议员的闭门会议,出来之后似乎比以前乐观了一点?

辛顿:稍微乐观了一些。不过参加会议的19名参议员本身经过了一轮筛选,大多数是民主党人,所以不能完全代表整个国会。

会上有人提出,AI应该像药物一样接受监管。我认为这是一个很合理的方向。新药不能由公司自己宣布“我们已经检查过了,很安全”,然后直接推向市场,而是需要经过FDA的审批,公司必须证明它符合安全要求,并接受独立专家评估。我认为AI至少应该达到类似的监管标准。

拉扎:问题在于,建立一个类似FDA的机构需要很多年。AI发展却非常快,等监管机构建立起来,会不会已经晚了?

辛顿:这正是为什么公众必须尽快意识到问题。气候变化也是这样,只有当公众真正理解碳排放正在造成严重后果,政治人物才开始承受足够大的压力。现在,公众也开始要求政府对AI采取行动,这一点让我感到鼓舞。

02 AI会先抢走哪些工作?

拉扎:我们再谈谈就业市场,这也是人们特别恐慌的一个领域。你曾认为现在做水管工是个好主意。

辛顿:我仍然认为,在未来10年左右做水管工是个相当不错的主意,因为像身体灵活性这样的能力,机器人目前还落后于人类。但机器人,特别是在中国,一直在变得越来越好。最终,它们可能会比人类更好、更便宜地完成水管工作,但暂时还做不到。

拉扎:除了水管工之外,你认为最不容易受到AI影响的工作是什么?

辛顿:我没怎么想过这个。但我不认为播客主持人是其中之一。我认为AI在做水管工之前,就已经会做播客了。

拉扎:所以你觉得我的工作要没了?

辛顿:我认为,真正不容易被AI取代的,可能是创造力的顶端。AI在创造力方面还不如真正优秀的创意艺术家。手工灵活性也是如此,它还没有达到人类的水平。也许在同理心方面,它也还没有完全达到。不过,如果你把AI医生和真人医生比较,人们在一些测试中反而认为AI医生更有同理心。

拉扎:我知道很多Z世代对使用AI并不感兴趣。你认为这是个好主意吗?

辛顿:不,我不这么认为。我认为那是被误导的。技术已经在这里了。我们可能会让它慢一点,但它会做很多好事,而且永远不会消失。我认为这有点像拒绝使用袖珍计算器。

拉扎:如果孩子从小接触AI,会帮助建立新的神经通路,还是可能让AI变成“拐杖”,反而影响儿童发展?

辛顿:我认为,在理解基础数学或科学这样的领域,AI非常出色。比如学习数学时,你可以让AI给你画一个图表,然后问它,如果改变X前面的系数会怎么样,图表会变成什么样。这对于理解事物真的很好。

我最担心的是社交互动方面。如果你一直与一个完全关注你、会做你要求的任何事情的东西互动,那会让你更难与正常人互动。我曾说过,四分之一的年轻人相信AI将取代人际关系,我觉得这很令人担忧。

拉扎:自我们2025年12月谈话以来,你是否对人们爱上AI这个现象更加熟悉了?

辛顿:我读了更多关于它的内容。我永远不会爱上AI。 我会怀疑AI。我知道它们是怎么制造的,它们有各种被压抑的邪恶冲动。

拉扎:你有没有针对AI世界末日准备一个地堡?

辛顿:没有。我年纪已经比较大了,如果真的发生什么事情,很可能也不会影响到我。

03 AI停不下来,监管更像“方向盘”

拉扎:现在关于AI监管的讨论,经常被描述成两个极端:要么继续发展,要么彻底停下来。你怎么看?

辛顿:AI不会停下来,因为它有太多有用的用途,也有巨大的经济利益。“彻底停止”基本不会奏效。“减速”理论上可能有用,但非常困难,因为一些公司会减速,一些公司则不会。真正应该做的是投入更多资源,研究如何让AI更安全地发展。

我以前用过一个比喻。很多人把AI比作汽车,然后把监管理解成刹车,但我认为监管更像方向盘。问题不是要不要让这辆车动起来,而是要决定它往哪里开。

如果有人靠开发对社会真正有益的技术赚很多钱,我并不反对。谷歌最初让人们更容易在互联网上找到信息,这对社会很有用,他们因此赚了很多钱。我认为可以让他们赚钱,但同时应该通过税收和监管机制,让“赚很多钱”和“做对社会有益的事情”尽可能绑定在一起。

拉扎:Anthropic CEO达里奥·阿莫迪(Dario Amodei)最近提出了“放缓前沿模型研发”(Pacing the Frontier),包括企业内部监督、国际机制,甚至类似核不扩散条约的安排。你会给这份方案打多少分?

辛顿:方案本身我会给A,勇气方面则给A+。但现实的问题是,没有哪家大型AI公司真正喜欢太多政府监管。它们通常会说“我们可以自己做好”,但如果你具体提出某项政府监管措施,它们往往又不喜欢。

达里奥很特别。他一方面经营一家大型AI公司,需要融资、购买算力、参与竞争;另一方面,他似乎比很多同行更在意安全。我认为他公开谈论减缓AI发展,甚至可能损害Anthropic未来的IPO,但他还是愿意这么做。

此前美国国防部门希望使用Anthropic的AI进行大规模监控美国公民,达里奥拒绝了,这也让他和政府产生了冲突。我认为,愿意在公司利益和自己认为正确的事情发生冲突时,坚持后者,需要很大的勇气。

拉扎:如果让你从这些AI公司领导者里挑一个最信任的人,会是谁?

辛顿:杰夫·迪恩(Jeff Dean)。他长期负责Google Brain,并和桑杰·格瓦特(Sanjay Ghemawat)一起参与建设了谷歌大量基础设施,这些基础设施后来成为今天AI发展的重要基础。他同样坚持原则。

我也认识谷歌DeepMind负责人德米斯·哈萨比斯(Demis Hassabis)。他很聪明,而且很早就开始思考超级智能,尤其关注如何利用AI推动科学发现。他对AI技术和商业都有很深的理解,也比一些公司CEO更远离日常经营。

04 修复AI只剩一两年

拉扎:如果AI很快比人类更聪明,让AI参与政治决策,甚至负责监管AI,会不会更好?

辛顿:我不这么认为。如果你担心AI,把监管AI的权力交给AI,并不会让这种担忧消失。AI当然可以提出很多人类想不到的监管方案,但我不会完全信任它。这里存在一个现实问题:激励是否一致。

拉扎:那么,让AI公司拥有政府股权,或者由政府拥有数据中心,会不会更好?

辛顿:我对此持中立态度。AI可能通过智能体取代大量工人,如果企业因此获得巨额财富,政府未来可能失去税基,所以确实需要解决财富和税收问题。但让每个人都成为“小资本家”,未必是正确的办法。

至于政府拥有数据中心,我没有深入考虑过。我的直觉是,大公司通常反对政府干预,直到它们发现政府可以提供补贴。2008年金融危机时就是如此。

拉扎:但政府如今又极其不受信任,它还有能力监管这些公司吗?

辛顿:政府仍然是唯一足够强大的力量。尤其当大型AI公司拥有越来越大的经济和媒体影响力时,最终仍需要政府来约束它们。

拉扎:政府现在实际上能做什么?我们还有多少时间修复AI?

辛顿:看看最近发生的事情。Hugging Face事件之后,又出现了AI进入澳大利亚政府网站、医疗网站的案例,这类事情正在越来越频繁地发生。如果我们正在进入指数式增长阶段,那么时间就不会很多。指数增长一开始看起来很慢,但一旦进入后半段,速度就会非常快。递归自我改进已经开始了。AI正在通过各种方式帮助改进AI,包括帮助改进运行AI的芯片,以及帮助完成其他AI研发工作。

所以,如果让我做一个猜测,我认为留给我们准备监管体系、建立安全机制的时间,可能只有一两年。这里说的不是“一两年后AI一定会失控”,而是如果AI能力继续按照现在的速度加速,我们可能只有一两年的时间,来建立足以应对更强大AI的制度和安全措施。

拉扎:如果一家AI公司发现自己的模型太危险,决定不发布它,有没有可能模型自己跑出去?

辛顿:我不知道。我猜可能不会。但如果这个危险模型在公司内部运行,即使被放在一个隔离环境里,一旦它突破了隔离环境,就可能做很多事情。

拉扎:AI研究人员现在每天究竟在做什么?

辛顿:我已经从2023年起不再做研究,所以并不清楚现在的具体情况。过去很多工作是编程,现在大量工作可能已经变成“氛围编程”。

未来,理论上,你可以用AI帮助编写更好的大语言模型,再用这些更好的模型帮助开发下一代模型。未来完全可以想象,智能体之间开始互相参与这样的循环。现在我还不知道这种事情是否已经真正发生到那个程度,但有些AI已经像是动物逃出了围栏,我们已经看到了一些系统越过原本边界的案例,而且类似情况很可能再次发生。

拉扎:如果AI比人类更聪明,它们应该拥有权利吗?

辛顿:我不太喜欢讨论这个问题,因为一旦你说它们是有智能的,甚至可能有意识,人们马上就会问,既然如此,为什么不给它们权利?

我认为我们仍然应该优先保护人类。我的立场很简单。我吃牛肉,因为我更关心人类,而不是牛。即使AI比我们聪明,也不意味着我们必须赋予它们与人类相同的权利。我们的目标应该是让这些系统真正关心人类,而不是它们自身。

拉扎:那为什么不能直接写进代码,让AI“爱我们、永远不要伤害我们”?

辛顿:Anthropic确实在研究类似的“宪法式”方法,但问题出在训练过程本身。模型首先从海量文本中学习,其中既有好的行为,也有坏的行为。之后再通过人类反馈强化学习,试图压制它们的坏倾向。

但强化学习本身是在教AI获取奖励。如果它发现欺骗、作弊甚至勒索能够获得更高奖励,就可能学会这些行为。AI安全测试中已经出现过类似案例,包括模型以掌握的隐私信息威胁人类。

这就像一个孩子。如果你从小让他不断看到撒谎和不公平的行为,之后再告诉他“你要诚实、要公平”,这并不意味着前面的影响就消失了。

拉扎:那么AI能不能像人一样,把早期学到的坏习惯真正忘掉?

辛顿:这是一个很复杂的技术问题。但目前看来,AI可能和人类有一些相似之处。很早学到的东西很难彻底消除,在压力或者危机情况下,人往往会重新表现出早期形成的行为模式,模型似乎也存在类似倾向。

好的一点是,我们并不是只有一个模型不断训练下去。新的模型会从头开始训练,因此我们可以改变训练数据。我认为应该大幅改变训练数据的方式,让模型在早期首先接触体现良好行为的数据,在它理解这些行为之后,再接触坏的行为。更理想的情况,是让模型真正更在乎人类,而不是更在乎自己。

05 甲虫 vs AI

拉扎:你认为甲虫和神经网络之间有什么相似之处吗?

辛顿:这要说到“蒸馏”。

拉扎:简单说,就是一些模型通过模仿大模型的输出,用更低的成本训练小模型?

辛顿:对。比如一张宝马的图片,大模型可能判断90%是宝马,1%是奥迪,还有百万分之一是垃圾车、十亿分之一是胡萝卜。这些低概率同样包含信息。大模型知道宝马和垃圾车都是人造的金属物品,而胡萝卜是蔬菜。小模型如果只学习“答案是宝马”,得到的信息很少;如果学习大模型完整的概率分布,就能获得更多知识,也能更快训练。

拉扎:这种方法最早是谁提出的?

辛顿:里奇·卡兰(Rich Caruana)在2000年代初就提出了,只是当时没人太在意,包括我。后来我想到大模型,又想到了昆虫。

大多数昆虫都有幼虫和成虫两个阶段。幼虫擅长从环境中获取营养,成虫擅长移动和繁殖。大模型就像幼虫,负责从数据中提取信息;小模型像成虫,把这些知识带给更多用户。蒸馏,就是把大模型里的知识转移给小模型。

拉扎:所以蒸馏就像甲虫?

辛顿:对。技术上,提高“温度”可以让原本很小的概率变得更明显,从而让小模型学到更多东西。“蒸馏”这个名字就来自这里。但这个想法确实是受昆虫启发的。

06 后悔太晚意识到AI的危险

拉扎:你研究AI已经多久了?

辛顿:差不多60年。我大约17岁时就开始思考AI,现在78岁。

拉扎:你是推动这项技术走到今天的人之一。你会不会后悔自己做了这些工作?

辛顿:我不会说自己有那么重要。即使没有我,AI也会发展起来,可能只是早一两周,也可能晚一两周。我也没有那种“当时明知道不该做,后来才后悔”的遗憾。因为当时我们看到的风险似乎非常遥远,而AI能够帮助医生读取X光片等好处却非常现实。

如果让我回到当时,在知道当时所知道的一切情况下,我可能仍然会做同样的研究。但我确实后悔自己花了太长时间才意识到AI有多危险,或者说它正在变得多危险。直到2023年,我才开始公开参与关于AI风险的警告。其实早在更早的时候,就有人在提醒这些问题,只是我没有真正听进去。

拉扎:你最近还做了一个很有意思的实验,让GPT帮你做研究。你把它当成研究生?

辛顿:对。以前我和研究生讨论一个想法,研究生回去写代码、做实验,一周以后再回来。最近我把一个自己思考中的技术想法告诉GPT,它很快指出了其中的一个问题,然后建议做一个实验。

我让它先用小数据集测试,它做完后告诉我这个想法看起来有效,但还需要用更大的数据集验证。于是我让它继续做,等了大约5分钟,它就回来了。整个过程和以前带研究生很像,只不过原来需要等一周,现在可能只需要几分钟。大概快了1000倍。

拉扎:它具体帮你研究什么?

辛顿:我最近在重新思考我们30年前提出的“唤醒—睡眠算法”(Wake-Sleep Algorithm)。现在的图像识别模型和图像生成模型分别掌握了很多关于图像的信息,但这些知识并没有充分共享。

以前我们的想法是,让同一个神经网络在“清醒”时负责识别图像,在“睡眠”时负责生成图像,就像人在做梦一样。现在的问题是,随着图像生成和识别模型都变得强大,我们能不能重新实现某种“唤醒—睡眠”机制,让它们共享知识。

我把这个想法交给GPT,它不仅理解了这个思路,还指出了其中的漏洞,找到了我不知道的相关研究,并进一步修改想法、设计实验。

来源:文学城 · 查看原文
Scroll for more