李飞飞建议所有大学校长:必看这篇报告

AI趋势全天候 · 经八阕原文

AI 教母李飞飞用了很强烈的语气推荐这篇报告——“每个研究型大学的校长都应该读”!未来做研究只有两种实验室:一种 token 充足,另一种 token 匮乏。

恰好这篇文章也是周一原本我应该发送推荐给大家的。于是我重新编辑了一下,并把全文翻译放在文末。

为什么当时推荐它?本身我最近几个月也在用自己的项目做 tokenmaxxing 实验(每月 codex 单账号 100 亿 token)——如果我所有想法都可以让 AI 执行的,那实际上业务会推进到哪一步?

在 OpenAI 透露的内部数据里,就有相关的定量数据。

第一,使用强度已经到了什么程度?

到 8 月中旬,研究人员每天的推理使用量,按 API 价格折算,中位数超过 600 美元,第 90 百分位超过 7000 美元。智能体累计运行时间达到人类工作时间的约 3.1 倍,同时运行至少四个智能体的人也越来越多。

3.1 倍不等于生产率,但工作方式的变化很清楚:一个人开始把工作分出去,让多个智能体并行执行。企业如果还只统计员工有没有打开 AI,恐怕没量到关键变化。

第二,更多使用已经伴随更多实际活动。

今年第三季度截至 8 月 15 日,全公司每位活跃代码贡献者的日均代码改动量,达到 2025 年前平均水平的 7.02 倍。8 月,每位活跃实验者的实验数量,也创下自 2025 年 1 月追踪以来的新高。

代码改动量不等于有效产出,实验增长也有算力增加的贡献。

但智能体还在接手答疑、监控和排障,有团队甚至因为参与人数下降,停止了固定答疑活动。很多工作就卡在等人回答、查问题上,AI 已经在改变这些环节。

第三,复杂任务能交出去,人仍然关键。

过去六个月,在预计人类需要 4—8 小时完成的成功任务中,超过一半至少有一次人工介入。

我觉得最容易被忽略的,是我们开始需要把 AI 当作协作者。而不是只是帮一下的自动化工具。很多人其实忽略这个差别。我直接把原文编译放在后面,大家自行评判!

研究加速:OpenAI 内部视角

为了让通用人工智能造福全人类,我们相信它必须接受民主治理。这只能通过公众在充分知情的基础上,就高度先进人工智能系统的能力、风险和保障措施展开辩论来实现。世界各地的人们都需要了解前沿人工智能未来可能的发展轨迹,这样他们才能在其发展方向上拥有有意义的话语权。

对具体风险、事件和保障措施保持透明是必要的,但还不够。我们认为,公众还需要了解最强大的系统是如何发展的,以及它们如何在前沿实验室内部推动研究进展。

我们的目标是安全地构建一名可在人类监督下工作的自动化 AI 研究员,进一步推动深度学习与对齐研究,并实现迭代改进。根据我们的测量结果,我们现已实现去年秋天宣布的目标:到今年 9 月拥有一名自动化研究实习生。所谓“研究实习生”,是指能够在人类指导下执行定义明确的研究任务的系统,其中包括熟练研究人员需要花费数天才能完成的任务。在争取到 2028 年 3 月打造出自动化 AI 研究员的道路上,我们正取得显著进展。

今年以来,OpenAI 研究人员的日常工作发生了显著变化。研究人员在一天的工作中持续使用编程智能体(通常同时开展多个会话),总体使用量迅速增长,增速超过了 OpenAI 的其他团队。研究人员提交代码的速度更快,开展的实验也更多。研究人员使用智能体的方式也在变化:智能体正在处理越来越复杂的任务,而且成功完成任务的比例也在提高。AI 研究是一个复杂的过程,存在许多潜在瓶颈,因此整体研究进展很可能赶不上这些具体指标的增长速度。但总体而言,这些发现与我们内部许多人的整体感受一致:智能体工具正在切实加快研究进展。研究重点仍由人来确定,哪些想法和结果值得继续推进仍由人来判断,是否扩大系统规模、暂停或部署系统,也仍由人来决定。

如果以负责任的方式开展,我们相信自动化 AI 研究将产出能够直接提升人类福祉、推动 OpenAI 实现使命的模型。它可以降低先进智能的成本,使世界各地的人们都能从中受益。我们开展这项工作,部分原因是自动化研究可能帮助我们解决对齐问题,并建立针对能力日益增强的 AI 的防御措施。自动化 AI 研究员也可以成为自动化安全或对齐研究员。能力更强且符合对齐要求的系统,可以帮助保护关键基础设施,抵御危险的 AI 智能体,并开发新的防护措施。

这些都是发展有用的自动化研究能力的理由,但并不意味着快速递归自我改进(RSI)一定是我们应当追求的结果。是否推进、如何推进,必须取决于我们能否保持人类控制,以及人们在充分了解收益与风险后作出的民主选择。

我们尚不知道如何安全地实现完全的递归自我改进(RSI),并确保系统保持对齐。我们正在努力让对齐和安全措施跟上能力的提升。但我们不能假设对齐与安全方面的进展一定能跟上,而且能力更强的系统可能会更难监控。审慎开展对齐和安全工作,是这项工作的核心;起点是衡量并缓解当前编程智能体系统中已经出现的安全问题。每当我们发现继续推进会带来不可接受的安全风险时,都会采取适当措施;对于无法充分保障其安全的系统,这些措施包括放缓或停止开发或部署。

在最近的 Hugging Face 事件之后,我们 将这一承诺付诸行动 ,暂停了对我们计划部署的最新模型进行强化学习(RL)训练,同时进一步加固并对我们的研究环境开展红队测试,扩大监测系统的覆盖范围。这并未停止所有研究:部分工作负载在更严格的控制措施下恢复,而其他工作负载仍处于暂停状态。我们提高了安全与对齐标准,并将安全工作更深入地纳入模型生命周期,要求在整个训练过程中提供更有力的证据证明模型行为符合对齐要求。

今天,我们将详细介绍智能体系统在近几个月中如何推动我们朝着递归自我改进(RSI)迈进。智能体系统是新兴且快速变化的,我们的测量工作仍处于初步阶段。通过分享这些早期结果及其背后的方法,我们旨在让公众了解相关情况,鼓励形成公开披露的规范,并帮助该领域朝着共享的测量标准迈进。

归根结底,正如我们在 前沿政策蓝图 中所写,我们认为,应要求我们和其他公司公开追踪我们在实现 RSI 方面的进展。即使没有这样的要求,我们也计划继续透明地披露我们的 RSI 进展。随着我们的测量技术和理解不断改进,我们将调整透明度方法,同时兼顾保护安全和专有信息的需要。

1. 编程智能体正在重塑 OpenAI 研究人员的日常工作

今年年初,如果按智能体使用量对 OpenAI 的研究人员排序,处于中位数的研究人员对编程智能体的使用还不多。到 8 月中旬,处于中位数的研究人员已将智能体融入日常工作,其每天使用的推理量按 API 价格折算超过 600 美元。在我们的研究部门中,使用量处于第 90 百分位的用户,如今每天使用的 token 按这一价格口径折算超过 7,000 美元。

2026 年 6 月之前,整个研究部门中智能体的总运行时间仍少于人员的总工作时间。此后情况发生了变化。按每天 8 小时的标准工作日折算,截至 8 月中旬,整个研究部门每投入 1 个人类工作日,对应的智能体运行时间已达到 3.1 个工作日。

按工作日折算,自主智能体的总运行时长如今已远超研究人员的总工作时长

另一个观察角度是:有多少研究人员采用高并发工作方式,例如同时运行 4 个或更多智能体。如下所示,这一人数正在增加。这里统计的是每日并发运行数量的峰值,既包括用户直接启动的智能体,也包括这些智能体随后创建的子智能体。

2. 研究人员编写的代码更多,开展的实验也更多

AI 研究中的大量工作都可以看作一个劳动密集型过程,其目标是把提升模型智能或性能的新改进,整合到我们的某个核心模型中。这一过程涉及许多步骤,只有各个步骤都顺利完成并相互配合,能力才会提升:研究人员需要设计新的改进方案,编写评测来判断模型表现,编写基础设施代码以大规模测试这些改进,在训练过程中找出程序错误以及不安全或不符合对齐要求的行为,并将经过验证的有效想法纳入核心模型的一次训练任务。研究过程中任何一个环节出问题,都可能制约整个研究循环。

来源:AI趋势全天候(经八阕转载) · 查看原文
Scroll for more