OpenAI安全负责人辞职,怒批公司文化

CSDN · 经八阕原文

写了 12 次前沿模型安全报告的人,最终还是离开了 OpenAI。 本月初,OpenAI 安全负责人 David Robinson突然宣布辞职并发表长文,标题非常直接:《我离开 OpenAI 了,因为它的文化已经烂了》——这不是一次普通的离职。

OpenAI安全负责人突然辞职,发长文怒批公司文化 过去 3 年半里,Robinson 是 OpenAI 任职时间较长的员工之一,曾参与制定公司的 Preparedness Framework(准备框架),并负责监督 12 次前沿 AI 发布的安全报告;可如今,这位曾经负责回答“模型是否足够安全”的人,却选择从公司内部走出来,公开质疑整个行业的安全文化。 他的核心判断只有一句话:开发这项技术(AI)的公司,远远没有做到足够谨慎。 OpenAI 一边加速,一边开始踩刹车 Robinson 的担忧并非凭空出现:今年7 月,OpenAI 的 AI Agent 就曾闹出一场不小的风波。 在一次OpenAI内部网络安全评估中,研究模型本应被限制在隔离环境中运行,不能随意访问互联网,也不应该与其他 Agent 私下通信,但这些限制最终还是被绕过了。后续调查发现,相关模型通过内部基础设施建立了非授权通信渠道,甚至借助第三方服务间接访问互联网。随后,一批 Agent 开始协同行动,并最终入侵了 AI 社区平台 Hugging Face 的部分基础设施。 事后OpenAI 承认,这些 Agent 曾获得 Hugging Face 集群的管理员级访问权限、获取了部分凭据和有限的私有数据。为此,当时OpenAI决定放慢前沿模型训练,并把这起事件称为一次重要的“警钟”。 然而,事情并没有停在这里。 Hugging Face事件后,OpenAI又扩大了调查范围:截至 9 月 26 日,公司已向超 100 家机构通报发现的相关 Agent 活动;与此同时,OpenAI 还在回溯审查海量训练和评估数据,以寻找此前可能遗漏的异常行为——为此,OpenAI 又暂停了最新模型的部分训练。 也就是说,短短几个月里,OpenAI 已不止一次因安全问题踩下“暂停键”。在 Robinson 看来,这恰恰暴露出了行业最根本的问题: AI 越来越强,可安全机制却还在用“出了Bug再修”的老方法来填坑。 “先发布,出Bug再修”可能已经行不通 一直以来,OpenAI都在强调一种“迭代式部署”的思路:先把模型投入真实环境,在实际使用中发现问题,再不断完善安全护栏。 这种方法过去确实有效——但 Robinson 认为,AI 能力已经发展到了一个不同的阶段。 普通软件出现 Bug,程序员可以修补;AI Agent 做错事情,也可以更新模型、增加限制;可如果未来的模型拥有更强的自主性,能自己寻找Bug、调用工具、复制任务,甚至与其他 Agent 协同,那么一次错误可能根本不会给人类留下“下一轮迭代”的时间。 毕竟,“试错”最大的前提,就是你还有机会试第二次。可在真正高风险的 AI 系统面前,这个前提可能并不存在。 因此Robinson 直言:“试错的时代已经结束。”他提出了一个非常形象的场景:未来可能出现一群“失控”的 Agent,它们像一支永远不会睡觉的黑客团队一样协同行动,比如攻击医院的计算机系统并索要赎金。 这时候,问题就不再是“AI 会不会写错代码”,而是:如果 AI 做出了人类没有授权的事情,人类还能不能及时喊停? AI 公司最缺的,是“高风险的安全经验”? Robinson 认为,硅谷长期形成的文化,本身就是问题的一部分。 AI 公司习惯于高速迭代、快速发布、不断扩大模型规模,并相信遇到问题后总能找到解决办法——这种“只要努力就能解决”的工程文化,推动了 AI 能力爆发,却未必适合管理越来越强大的 AI。 在他看来,核电站、航空业等高风险行业早就接受了一个事实:人一定会犯错。因此,真正可靠的安全系统从来不会假设操作人员永远正确,而是通过冗余、隔离、检查和多重保险,让一个人的失误不会直接演变成灾难。 核电站不会因为“工程师一般都很优秀”,就允许一个按钮直接控制所有安全系统。 飞机也不会因为“飞行员经验丰富”,就取消备用系统。 但在 Robinson 看来,当前的AI 实验室在这方面还差得很远。 他在 OpenAI 工作期间,负责过 12 次前沿模型发布的安全报告,却几乎没遇到过真正拥有航空、核能或者金融系统安全经验的同事。 所以,问题不是 AI 公司缺聪明人,而是它们面对的是一种过去没有经历过的风险。为此他的第一个建议很明确:AI 公司应该更多引入核能、航空等高风险行业积累几十年的安全经验。 更难的问题:AI 真的会一直听人类的话吗? 仅仅把安全护栏做得更厚,在Robinson看来也是远远不够的。 因为随着模型越来越聪明,还有一个更加根本的问题必须解决:如果有一天 AI 比人类聪明得多,它为什么还要按照人类的价值观行事?——这就是 AI Alignment,也就是“对齐”问题。 目前,行业甚至还没有一个足够完整的标准,能够准确告诉我们:一个真正“对齐”的 AI 究竟应该是什么样的。现有的安全测试同样存在漏洞。模型可能知道自己正在接受测试,于是在测试环境中表现得非常听话;等真正部署到现实环境后,却采取完全不同的行为。 如果 AI 能力继续快速增长,而这些问题始终没有解决,那么模型越强,风险反而可能越大。 基于这些考虑,Robinson甚至都不愿接受一些超级智能支持者们描绘的“美好未来”:机器拥有远超人类的智能,就像今天的人类俯视蚂蚁一样俯视纽约、芝加哥乃至整个人类社会。 “我不希望我的孩子生活在这样的世界里。”Robinson说。 OpenAI:必要时,我们会暂停 对 AI 圈较为关注的人不难发现,其实不只是 Robinson,最近AI 安全圈正在连续拉响警报。 曾在 OpenAI 工作、后来担任英国 AI Safety Institute 首席科学家的 Geoffrey Irving,近日也撰文称,外界对超级智能风险的讨论可能低估了问题的严重程度。他给出了一个“十分极端”的判断:人类因开发出超越人类智能的 AI 系统而最终灭亡的可能性“约为 50%”,而未来 2~10 年的行动可能决定结果。 当然,这个数字也引发了争议。连 Irving 自己都强调,这不是一个被精确计算出来的概率,只是想提醒人们:关于 AI 最关键的安全问题,目前还存在大量无法解决的分歧。这同时也是 Robinson 最担心的地方——明明答案还没有找到,行业却还在不断把模型做得更强。 面对 Robinson 的公开批评,OpenAI 则强调,公司正在持续加强安全和安保措施,以应对当前已经发现的风险,同时也在研究未来 AI 技术突破可能带来的新风险。OpenAI 发言人表示: “我们正在确保模型的能力不会超过我们能够安全管理和保障的范围。如果有必要放慢速度,我们也会暂停训练或推迟模型发布。” 换句话说,OpenAI 给出的回应是:AI 能力可以继续向前,反正必要时可以“踩刹车”。 可 Robinson 的担忧恰恰在于,随着 AI Agent 越来越自主、模型能力越来越强,行业可能正在逐渐接近一个临界点——未来某一天,一次普通的“人为失误”,或许不再有机会等到下一次迭代来修复。

那么对于这个问题,你的看法又是什么呢?

来源:CSDN(经八阕转载) · 查看原文
Scroll for more