谷歌首席科学家离职前:我低估了AI老编聊科技

8/5/2026

一年前,Google 首席科学家 Jeff Dean 在 AI Ascent 2025 峰会上预测:到 2026 年,可能出现能够全天候工作、能力接近初级软件工程师的 AI 系统。

一年后,也就是 6 天前,他在一期 YC 访谈中承认,自己低估了 AI 的进展速度。模型处理复杂任务的能力,增长得远比他当时预想的更快。那么,在 Jeff Dean 看来,AI 接下来还会以多快的速度向前推进?创业公司又该如何在通用模型不断扩张能力边界的时代生存下来?

今天凌晨,这期访谈又有了不同的分量。Jeff Dean 宣布,明天将是自己在 Google 的最后一天。效力 Google 27 年后,这位被誉为“程序员中的程序员”、深度参与 Google 系统架构和 AI 技术建设的传奇工程师,将与长期合作伙伴 Sanjay Ghemawat、Oriol Vinyals 和 Quoc Le 共同创立 Discovery Loop,一家聚焦机器学习、科学和工程前沿研究的公益性公司。Google 将作为创始投资方和云计算合作伙伴继续与他们合作。

据 WIRED 披露,这个创业想法其实只是几周前才浮出水面。为了挽留这支核心团队,Alphabet CEO Sundar Pichai 还曾在多次会面中试图说服他们“别摘工牌”。但最终,几人还是决定离开大公司体系,去换取一家初创公司才有的乐趣、速度和自由。

Jeff Dean 在告别信中写道,自己见证了 Google 从一家只有 25 人的公司,成长为拥有 19 万多名员工的科技巨头。如今,Google 已有 13 款产品的用户规模超过 10 亿。从搜索、邮件、翻译和视频,到大规模计算、自动驾驶和 AI 系统,他参与建设的技术几乎贯穿了 Google 的整个发展历程。

而促使他们离开的一个重要原因,也恰恰是大公司难以摆脱的惯性。正如 Oriol Vinyals 所说,在大型组织内部,要推动任何激进变化,都必须先克服层层阻力;他们想做点不一样的东西。颇有意思的是,迄今为止,这家新公司甚至还没来得及招人、租办公室,至于谁来当 CEO,团队内部短暂停顿后,大家把目光投向了 Jeff Dean——“我想应该是我吧。”他说。

因此,这期发布于 Jeff Dean 离职前夕的访谈,也像是他站在职业生涯转折点上,对 AI 下一阶段的一次集中判断。节目中,他与 YC 合伙人 Diana Hu 讨论了 AI 从“模型为中心”转向“上下文工程”的范式变化、推理硬件正在出现的巨大机会,以及创业者如何在通用模型越来越强、越来越多应用可能被模型直接吞并的时代,找到真正值得坚守的生存空间。

本文基于该访谈视频整理,经 InfoQ 编辑。

Q:去年你说到 2026 年会出现能力接近初级工程师的 AI。一年过去了,这个预测打脸了吗?

A:相当准确,但我低估了一件事:模型处理越来越复杂任务的能力,增长速度比我预想的快得多。而且这种能力正在溢出到编码之外的领域,基于 Agent 的系统开始真正崭露头角。

Q:对 2027 年的大胆预测是什么?

A:深度学习系统将实现全自动的问题分解和自动化实验循环:把问题拆成子问题,自动跑实验,整合结果,得到一个改进后的系统。而且这不只适用于机器学习,任何有可衡量目标的科学和工程领域都能用上。

Q:2001 年 Google 把搜索索引装进内存,2026 年那个“装进内存”的时刻是什么?

A:高性能、低能耗的专用推理硬件。推理是让 Agent 系统触达更多人的关键,专用硬件能带来 50 倍延迟改善和 30-80 倍能效提升。当年省掉的是磁盘寻址的物理延迟,今天省掉的是通用计算的多余步骤。但这次赌注更高,因为 Agent 需要的是成千上万次连续推理,每一次延迟都在累积。

Q:人们现在对 AI 最大的误解是什么?

A:大家都觉得 Agent 就是跑一两个小时的临时任务,但配合足够强的底层模型,你可以让 Agent 连续跑上几天甚至几周。

Q:那张催生 TPU 的餐巾纸数学,到底算出了什么?

A:2013 年语音识别效果暴增,我们算了笔账:如果每个用户每天对着手机说三分钟话,用 CPU 根本撑不住,于是造了 TPU。几年后 Transformer 横空出世时,它恰好成了根基。

Q:AI 时代的延迟数字清单,最该记住哪个数?

A:做一次计算消耗约一皮焦耳,但把数据搬进处理器的那一小段路,能耗是它的 1000 倍。这个差距决定了你必须做 batching,把很多样本拼在一起处理,把成本摊成“一千倍除以 batch size”。

Q:创始人该怎么选要做的领域?

A:拿当前最强的通用模型去测你想做的领域,如果模型成功率在 0% 或 1%,那是好信号;如果在 20%,那是危险信号,说明能力已经萌芽,下一代模型很快会覆盖。

Q:当 Agent 写完所有代码,什么技能变得稀缺?

A:品味,知道该让你的 Agent 去解决什么问题。一是靠解决过大量问题的经验,二是写下你觉得未来 12 个月可能重要的十件事,一年后回来复盘哪些真的变重要了,三是做疯狂的思想实验,比如“如果晶体管每天出错 20 次而不是每一百万年一次,系统该怎么设计?”

高性能、低能耗的推理硬件革命

Diana:去年 5 月在 AI Ascent 大会上,你说到 2026 年左右,可能会出现能够全天候工作、能力接近初级工程师的 AI 系统,现在我们离这个预测有多近?

Jeff:我觉得模型在处理基于 Agent 的长时间运行编码任务方面进步非常大。现在看起来很明显,它们确实已经相当有能力了,取决于你对“初级工程师”的精确定义,这个预测现在看来相当准确。

Diana:那你当时低估了什么?

Jeff:我认为处理越来越复杂任务的能力,其增长速度比我预想的要快得多。而且,在编码之外的领域,这些基于 Agent 的系统也开始真正崭露头角,我认为这将是未来一个重要的趋势。

Diana:你觉得 2027 年版的预测会是什么?

Jeff:我认为你会看到更多机器学习系统自身的自动化。具体来说,就是让机器学习系统通过运行大量实验来提升自己的能力,把问题分解成子问题,在紧密的自动实验循环中运行这些子问题,然后把结果整合起来,从这种全自动的问题分解和自动化实验中得到一个改进后的系统。而且这不仅适用于机器学习,也适用于科学和工程的其他领域。基本上任何有可衡量目标的事情,如今都能取得很大进展。

Diana:2001 年,Google 搜索还是跑在硬盘上的。你和 Sanjay 算了一笔账,意识到在某个时间点,整个搜索索引终于能装进所有运行中计算机的内存里。你们做出了那个激进的决定,基本上在几天之内就和 Sanjay 一起把一套全新的、基于内存而非硬盘的搜索版本推到了生产环境,正是这件事让 Google 成为了今天的 Google。

历史总是在重演,那么在 2026 年的当下,那个“能装进内存了”的时刻是什么?在座所有人都应该思考和设计的那个转折点在哪里?

Jeff:情况有些不同,但我想说的是,你会看到越来越多高性能、低能耗的推理硬件系统出现。因为现在大家都意识到,推理是让这些 Agent 系统触达更多人的关键。延迟真的很重要,而硬件的专门化是让你在能效和延迟上都优于 GPU 或 CPU 这类通用计算设备的核心途径。

Diana:所以你的意思是我们也许不用再等待了?

Jeff:没错,想象一下,如果延迟能改善 50 倍,你能做些什么?

Diana:在座大约 6000 人,他们脑子里关于 AI 的哪个假设,其实已经是错的了?

Jeff:我想可能是人们还没有充分意识到,Agent 系统能跑多久的潜力。大家总觉得 Agent 就是跑一个小时、两个小时的临时任务。但事实上,在某些问题领域,配合足够强大的底层模型,你可以让这些 Agent 连续跑上几天甚至几周,真正去解决那些复杂的、长期的问题。这绝不仅仅是“多等一会儿”的区别,而是质变。

Diana:那你实际跑过哪些跑了几个星期的任务?你让 Agent 去解决什么?

Jeff:比如,你可以让 Agent 去实现一个全新版本的软件,用不同的编程语言重写,可能具备更好的安全性或性能特性。它真的能认真地去完成这件事,而且完成得相当靠谱。

TPU 的起源

Diana:大家一直都知道你特别擅长“餐巾纸数学”。有个关于你的故事是,2013 年的语音识别刚上线时,你做了个估算:如果每个谷歌用户每天用手机对着语音识别系统说三分钟话,整个服务器的规模就得翻倍,那成本高得吓人。于是你构建了一个定制芯片,那就是 TPU 的起源故事。

Jeff:当时的情况是,我们训练的基于深度学习的语音模型,效果开始变得非常好,但计算开销比老的语音系统贵得多,不过它把错误率砍掉了一半。这相当于把语音识别领域 20 年的进步,浓缩在几个月里就实现了,我们只是调整了一下模型、稍微扩大规模、拿到更好的数据。于是我们开始担心:如果语音识别效果大幅提升,人们的使用频率也会大幅上升。

所以那个粗略计算实际上就是关于:如果人们开始更频繁地使用语音识别,用来口述邮件、对着手机说话,会发生什么?算完之后我们发现,当时用 CPU 跑根本撑不住,于是我们造出了 TPU,一种专门为低精度稠密线性代数设计的芯片,而这正是今天几乎所有机器学习算法的核心。

Scroll for more