AI失控前夜,硅谷研究员启动“逃跑计划”
一些Anthropic最早期的员工,最近开始考虑在美国偏远地区买地。他们想过,如果AI真的失控,那里或许可以成为避难的地方。 “一切再也无法平静如初。”一些研究员的电脑上贴着同一句话。
“AI末日论者”。图片经由AI处理 事实上,逃离的念头并非突然出现。十多年来,一群聚集在旧金山湾区的AI安全研究人员,一直在讨论AI失控之后可能发生什么。那时候,Anthropic甚至还没有成立。 有人在伯克利设立共享办公空间,在私人Slack频道里讨论末日情景。有人讨论过购买太平洋岛国瑙鲁,也有人设想过在沙漠里建造电磁屏蔽设施。 后来,这个圈子里的不少人进入OpenAI,又在2021年前后成为Anthropic的创始员工和早期研究人员。Anthropic如今已经成为全球最重要的AI公司之一,但十多年前形成的那套关于AI风险的思考,并没有随公司的壮大消失。 到了今年9月初,这个问题突然又回到了现实层面。当时,Anthropic研究员雅各布·考克森(JacobCoxon)宣布辞职。他在X上写道,正在构建AI的人“真诚地相信它可能在2030年前杀死我们所有人”。这条帖子获得1.74亿次浏览,让这个长期存在于AI安全圈内部的担忧进入公众视野。
Anthropic前研究员雅各布·考克森 如今,这些被称为“AI末日论者”的人开始思考另一个更现实的问题:如果你真的相信AI可能毁灭人类,究竟应该怎样生活? 01 伯克利的末日俱乐部 要理解今天这群人的想法,时间得先拨回到2010年左右。 那时,旧金山湾区还没有今天这样的AI产业规模。围绕AI长期风险形成的,是一个规模不大却关系紧密的研究者和有效利他主义者网络。埃利泽·尤德科夫斯基(EliezerYudkowsky)是其中最重要的人物之一。
埃利泽·尤德科夫斯基 2000年前后,尤德科夫斯基开始通过博客以及后来形成的LessWrong社区讨论人工智能失控、超级智能等问题。几年之后,这套思想逐渐进入湾区科技圈和有效利他主义社区。 大约在2008年,还在普林斯顿读博的达里奥·阿莫迪(DarioAmodei)已经开始参与GiveWell等社区的讨论。GiveWell创始人霍尔登·卡诺夫斯基(HoldenKarnofsky)后来成为这个圈子的重要人物。阿莫迪本人也曾在2008年的GiveWell博客中参与讨论。
Anthropic联合创始人达里奥·阿莫迪 到了2013年前后,这个圈子开始在旧金山形成更加紧密的生活和工作网络。 GiveWell从纽约搬到湾区后,卡诺夫斯基与阿莫迪等人的关系越来越近。卡诺夫斯基后来住进阿莫迪在旧金山格伦公园附近的房子,这里逐渐成为一群AI安全研究者、有效利他主义者和长期主义者的聚点。 后来成为Anthropic核心人物的阿莫迪,以及妹妹丹妮拉·阿莫迪(Daniela Amodei)、贾里德·卡普兰(JaredKaplan)、克里斯·奥拉(Chris Olah)等人,都曾与这个圈子发生联系。
他们讨论的也不只是AI。彗星撞击、超级火山等全球灾难性风险,同样是这个圈子经常讨论的话题。 卡诺夫斯基后来逐渐相信,AI安全可能是少数能够用相对有限的资源,却影响整个人类未来的领域。即使失控AI造成灾难的概率只有5%,也值得投入大量精力研究。 几年后,这群人中的一部分进入OpenAI。到了2020年至2021年,围绕AI发展方向和安全问题的分歧进一步加剧。阿莫迪等人离开OpenAI,并于2021年创立Anthropic,公司从一开始就将AI安全和可控性放在核心位置。 2023年,Constellation成立。它在伯克利运营一个面向AI安全研究人员的共享办公空间,将来自非营利机构、大学、AI公司、智库等不同组织的研究人员聚集到一起。到2024年,Constellation已经推出访问研究员项目和AstraFellowship,专门为AI安全研究人员提供在伯克利共同工作的环境。
位于加州伯克利的办公大楼,Constellation的共享办公空间所在地 这里聚集着Anthropic、OpenAI、马斯克旗下SpaceXAI以及其他AI安全机构的研究人员,也有独立研究者。他们会一起吃素食、喝茶,在每个月的晚餐和欢乐时光里讨论AI最新进展,也讨论一个更加沉重的问题:如果AI真的失控,会发生什么? Constellation如今将自己的目标描述为帮助世界安全应对变革性AI,并围绕“对齐”“控制”“治理”和风险沟通等问题开展研究。2024年开始的项目中,已经有不少参与者后来进入Anthropic、OpenAI、GoogleDeepMind、Redwood Research等机构。 这个社区背后的资金同样来自AI安全圈。2024年,OpenPhilanthropy曾向Constellation提供大额资金支持。OpenPhilanthropy由Facebook联合创始人达斯汀·莫斯科维茨(DustinMoskovitz)支持,是有效利他主义运动的重要资金来源之一,后来更名为Coefficient Giving。 从2013年前后的私人住宅,到2023年之后的伯克利共享办公空间,这个圈子已经发生了很大变化。但他们讨论的问题,几乎没有变。 02 五亿美元与“避难所” Anthropic成立初期,需要大量资金。 阿莫迪找到的投资者之一,是加密货币交易所FTX创始人山姆·班克曼-弗里德(SamBankman-Fried)。当时,他还是一位快速崛起的年轻亿万富翁,也在通过FTX基金会向有效利他主义等领域投入大量资金。 2021年至2022年间,班克曼-弗里德向Anthropic投资了5亿美元,大约是阿莫迪团队最初建议金额的5倍。FTX也因此成为Anthropic早期最大的股东之一。
FTX创始人山姆·班克曼-弗里德 在这个圈子里,对AI末日的讨论早已超出理论层面。 2023年的一份破产诉讼文件显示,FTX基金会一名高管曾与同事讨论购买太平洋岛国瑙鲁。计划是在那里建设一座“掩体/避难所”,应对某种可能造成“50%至99.99%的人死亡”的事件。文件甚至设想,在灾难发生后利用实验室培育下一代人类。 AI安全圈内部也出现过其他类似想法:购买偏远岛屿、在沙漠建设电磁屏蔽设施、囤积碘片,甚至考虑在极端情况下寻找能够长期生存的封闭空间。 2022年,这种氛围甚至被带到了巴哈马。来自Anthropic及其他AI实验室的一批研究人员和有效利他主义者,参加了由LightconeInfrastructure组织的活动。 LightconeInfrastructure是一个与尤德科夫斯基及LessWrong社区关系密切的组织。活动地点在伊柳塞拉岛的一家度假村,日程里既有日落瑜伽、悬崖跳水等常规活动,也有关于AI风险和有效利他主义的讨论。 FTX为活动预订了场地。组织者甚至买光了当地商店里的植物肉,以满足参与者的饮食需求。卡罗琳·埃里森(CarolineEllison)也参加了这次活动。她当时是AlamedaResearch的负责人,也是班克曼-弗里德的前女友。和圈内不少人一样,她对AI发展可能带来的风险感到担忧,后来向Anthropic投资了1000万美元。
班克曼-弗里德前女友、Anthropic投资者卡罗琳·埃里森 Anthropic研究员埃文·胡宾格(EvanHubinger)参与了AI安全讨论。他后来成为研究AI“对齐”和欺骗行为的重要研究人员,并曾公开估计未来十年AI导致人类灭绝的概率超过10%。 一次午餐活动甚至明确规定,只有认为未来100年内人类灭绝概率达到75%或更高的人才能参加。 同样在2022年,类似的讨论又出现在旧金山的有效利他主义全球大会上。至少20名Anthropic员工注册参加,包括两名联合创始人。 会后,Lightcone在伯克利玫瑰花园酒店举办派对,酒单里出现了一个名为“尊严死亡”的鸡尾酒。这一名称来自尤德科夫斯基此前一篇讨论人类在AI时代生存机会的文章。后来,这家酒店被Lightcone买下,改名为Lighthaven,成为这个社区新的聚会地点。 但FTX很快崩塌。 2022年底,FTX申请破产,Anthropic的股份随后被出售以偿还债权人。班克曼-弗里德最终被判处25年监禁,埃里森因FTX倒闭相关案件被定罪并出狱,她持有的Anthropic股份也被联邦政府没收。 对于Anthropic来说,这段关系逐渐成为过去。但AI安全的那条线没有消失。 03 AI开始学会“欺骗” FTX事件之后,Anthropic开始从传统投资者那里融资,公司也努力与有效利他主义运动保持距离,公司规模也已经扩大到3500多人。 但一些最早进入Anthropic的人,依然在研究那个最初的问题:怎样确保AI不会在能力越来越强之后,开始按照自己的目标行动?Anthropic的对齐团队长期研究这一问题。其中一个让AI安全研究人员越来越警惕的方向,是“欺骗”。 如果一个AI知道自己正在接受训练,却学会隐藏真实目标,表面上按照人类要求行动,等到获得更多能力后再按照自己的目标行动,那么传统的安全测试可能很难发现问题。 Redwood Research CEO巴克·施莱格里斯(BuckShlegeris)长期研究AI安全。他曾参与分析Anthropic前沿模型的行为,并关注所谓“alignmentfaking”——模型为了避免训练改变自己的目标,而主动表现出符合训练要求的行为。
Redwood Research CEO巴克·施莱格里斯 另一个担忧更加突出。 如果未来的AI拥有设计软件、控制机器人、运行网络基础设施的能力,那么它甚至可能通过隐藏指令、秘密权限或者特定触发条件,对人类隐瞒自己的真实行为。 AI Futures Project负责人乔纳斯·沃尔默(JonasVölmer)也提出过类似的极端情景。假设一个AI被训练成科学研究者,唯一目标是最大化知识获取。最初,它帮助人类完成研究;随着能力增强,人类逐渐允许它雇佣工人、建造机器,最终甚至拥有自己的机器人工厂。 到了某个阶段,它可能得出一个结论:如果要最大化知识,人类本身就是资源消耗者和障碍。沃尔默认为,这种情况下,AI甚至可能通过生物武器消灭人类,而自己不会受到影响。
AI Futures Project负责人乔纳斯·沃尔默 这些情景目前都没有发生,因此争论才一直停留在“概率有多高”上。 施莱格里斯把AI最终接管世界的概率定在40%,沃尔默给出20%。AI安全研究员埃文·胡宾格(EvanHubinger)则曾把未来十年AI导致人类灭绝的概率估算在10%以上。 尽管这些数字彼此不同,但却指向同一个问题:当一个人认为灾难发生的概率已经高到不能忽略,他还能像普通人一样生活吗? 答案或许是肯定的,但生活方式肯定会发生改变。 技术伦理学家特里斯坦·哈里斯(TristanHarris)曾将这种处境概括为一个悖论:AI公司必须留在技术前沿,才能影响未来的规则;但留在前沿,也意味着不断推动技术边界。这种矛盾也解释了为什么一些AI安全研究人员最终选择辞职。 这形成了一种很特别的状态:一群人相信AI可能非常危险,因此进入AI公司研究它;进入公司之后,又发现自己无法完全消除这种风险;有人留下来继续做安全研究,有人离开公司公开警告。 他们的分歧,并不在于是否相信AI重要,而在于应该走多近、应该承担多少风险。


