Codex负责人:程序员最费时间的工作要变了
Tibo:“Maintenance is ... a tax.”
Tibo:“维护就像一笔持续支付的税。”
对开发者来说,这笔“税”一点都不抽象。
功能上线只是一次性开支,后面的每一次修改维护,都是一笔账单。
Tibo认为,Coding Agent会先改变这部分账单。大量令人拖延的维护工作,会被Agent代替。
备注:Tibo是Codex早期创建者之一,如今负责OpenAI核心产品与平台,Codex也在他的管理范围内。
最近的一场访谈中,他聊了Rust、开源、模型、代码审查、系统重构和Codex与ChatGPT的合并。
Tibo还反复提到一个容易被忽略的部分:模型只提供推理能力,决定Agent能否进入真实项目的,是包在模型外面的harness。
这些话题看起来很散,放到一起却指向同一件事:OpenAI并不只想让Codex更会写代码,而是想让它进入软件的整个生命周期。
Tibo认为,维护仍然必要,但其中很多步骤会被自动化
以下为访谈内容,我们进行了翻译与整理。
软件写完只是开始,贵的是以后每一次修改
Tibo举了一个最直接的例子,依赖升级。
Tibo:“只要更新版本号、读懂变更日志,再根据代码判断影响,这类任务完全可以自动化。”
以前,团队往往会把这类工作一拖再拖。
它不会直接带来新功能,却可能打破构建、引入兼容问题,还要补测试和准备回滚。很多技术债,就是从一句“下个迭代再处理”开始的。
当Agent可以读变更日志、搜索全仓库、修改调用点、运行测试并继续修错,这笔小账开始变得好算。开发者不用一个文件一个文件地搬迁,而是先给它一个明确终点:哪些测试必须通过,哪些行为不能变,哪些目录不允许碰。
但“自动维护”有一个前提。Tibo特意提到了写得清楚的变更日志和文档。一个没有测试、没有边界、连启动命令都要靠老员工口口相传的项目,换成再强的模型也不会突然好维护。
Codex开始接触的,是整个项目
OpenAI内部给了一个很直观的使用场景。
Tibo:“Have you asked Codex?”
Tibo:“你问过Codex吗?”
新员工想知道一个项目进展到哪,谁在处理某个问题,以及当初为什么做了某个技术决定,同事会先让他去问Codex。原因也很直接:它已经接上了Slack、文档和代码。
Codex在OpenAI内部已经接入沟通记录、文档和代码
这和在编辑器里点一次“补全”完全是两件事。
当Agent只能看当前文件,它是一个代码生成器。当它能追查需求来源、查历史讨论、读接口文档、运行命令并查看日志,它才开始参与项目。
开发团队会很快碰到一个现实问题:你是否愿意让Agent读到这么多东西?
接入越广,Agent越了解项目;接入越广,权限和数据风险也越集中。公开频道、可搜索的决策记录、分级权限和操作日志,不再是文档团队的“卫生工作”,它们直接决定Agent能不能进入真实研发流程。
Agent能不能干活,模型只决定了一半
Tibo花了不少时间讲harness。这是整场访谈中最值得开发者细看的一部分。
Tibo:“The harness ... is always a little bit ahead.”
Tibo:“harness总会比模型往前多走一小步。”
Harness要把上下文、工具、安全边界、开发者指令和反馈循环装起来,再把模型放进去。
当模型还不够稳定时,harness用工具、规则和反馈提高可靠性
模型提供推理能力,harness负责把它变成可执行、可检查的工程过程
OpenAI团队每天都要做一个取舍:某个缺陷是应该改harness,还是等模型本身升级?
Tibo:“如果模型一个月后就能修好,也许不必写上万行代码去绕过它的缺陷。”
这对企业自建Agent同样适用。不要遇到模型失败,就继续叠加提示词、规则和分支逻辑。先把问题归类:是上下文没给到,工具返回不稳定,验收条件不清楚,还是模型确实不会。这四类问题,修法完全不同。
Codex Agent循环,Agent会在工具结果和模型判断之间反复迭代
Codex为什么开源,还允许接入其他模型
Codex CLI开源时,Tibo的理由很简单:他们正在做一个会改代码的Agent,早晚会让它反过来改自己。如果代码对社区开放,开发者可以直接参与,OpenAI也能从真实使用中学到东西。
Tibo:“如果你在做一个优秀的编程harness,为什么一定要把它和某个模型绑死?”
Tibo认为,编程harness不必与单一模型供应商绑定
这句话决定了Codex的一个重要边界:它可以是OpenAI产品,底层harness却不必只服务OpenAI模型。
对开发团队来说,这比“又多一个模型可选”重要得多。
模型会迭代,价格会变,限额和合规条件也会变。如果任务编排、工具接入、验收规则和历史记录都只能跟着一家模型走,团队换模型的成本会非常高。
真正值得留在自己手里的,是任务记录、评测集、权限边界、工具协议和可回放的执行日志。这些东西能带着走,模型才是真的可替换。
代码审查不会消失,逐行找错正在失去价值
Tibo:“The role of code review is changing.”
Tibo:“代码审查的作用正在改变。”
Tibo早期参与过Codex的代码审查模型。
他说,模型已经能沿着依赖向下追三四层,去查一个第三方库的真实实现,再判断文档里的承诺是否和代码一致。这类问题,人工审查往往要花几个小时,甚至只有熟悉那个库的人才能看出来。
模型可以追踪多层依赖,帮人找出逻辑、正确性和安全问题


