Ilya:Scaling时代结束了
本文为前OpenAI首席科学家、大模型底层范式奠基人Ilya Sutskever,离开OpenAI创办SSI后最具范式颠覆性的重磅访谈。
过去五年,全球AI产业依赖预训练大模型、算力堆叠、参数扩容的规模化增长逻辑。但这套范式在产业落地中已经走到明显瓶颈:通用静态模型无法适配企业私域知识、无法适配行业专属逻辑、无法随业务持续进化。
Ilya在本次访谈中正式宣告:AI规模扩张时代终结,研究时代重启。未来AI的核心竞争力,不再是更大的模型、更多的算力,而是更强的学习机制、更高的样本效率、推理时持续迭代能力。
这恰好解释了当下企业AI落地的真实趋势:企业不再需要一次性预训练的巨型模型,而是需要依托内部数据持续后训练、持续迭代、形成数据飞轮的进化型AI。以下为访谈全文:
AI走出Scaling时代
Dwarkesh:欢迎来到本次播客。今天嘉宾是Ilya Sutskever。Ilya,很高兴你能来。
Ilya Sutskever:谢谢你邀请我。
Dwarkesh:距离我们上次聊天已经过去一段时间了。很多事情都发生了变化。你离开了OpenAI,创办了新公司SSI。在开始深入聊技术之前,能不能先讲讲,离开OpenAI之后,你的想法有哪些变化?
Ilya Sutskever:好的。最大的变化,是我有机会从头思考,到底要怎么构建通用人工智能(AGI)。在OpenAI的时候,我们要同时推进很多条路线,受很多现实约束。现在,我可以专注于我认为最核心、最根本的那条研究方向。
我依然相信AGI是可以实现的,并且我们距离它并不遥远。但我现在更清楚,单纯依靠扩大模型规模、扩大预训练算力这条路,很难走到终点。这是我最近最重要的一个判断。
Dwarkesh:很多人会觉得,模型只要足够大,所有问题都会自然消失。为什么你不再认同这个观点?
Ilya Sutskever:我们先回顾一下过去。大约从2020到2025,是Scaling时代。在这个时代,Scaling Laws是有效的:你投入更多算力、更多数据、更大的模型,模型能力就会稳定、可预测地提升。
这是一个非常棒的发现,而且对产业极其友好。因为它是低风险的投资。你只要投入资源,按固定配方放大,就能拿到确定的收益。企业非常喜欢这种模式。
但现在情况变了。规模已经变得非常巨大。很多人内心深处依然会想:“只要把模型再放大100倍,一切都会质变。”当然,模型放大100倍,肯定会有些地方变得不一样。但我不认为,单纯放大100倍,就能带来质的飞跃,通往AGI。
所以,我们正在走出Scaling时代,重新回到Research时代。只不过这一次,我们手上拥有强大的计算机。
Dwarkesh:你说的“Research时代”,和Scaling时代最核心的区别是什么?
Ilya Sutskever:在Scaling时代,核心工作是工程化放大。你不需要发明全新原理,只要把已知的配方不断做大,性能就上涨。这是一种“暴力美学”。
而研究时代,核心是发现缺失的基础原理。算力依然重要,但算力只是工具。真正的瓶颈不再是算力或者数据量,而是算法本身。我们缺少某些关键的机器学习原则。找到这个原则,才是下一步。
静态模型缺少自我判断能力
Dwarkesh:那现在大模型最核心的缺陷是什么?
Ilya Sutskever:最大的问题是样本效率太低,以及缺少内在的价值判断。
你可以观察人类。人类学习新任务,只需要很少样本。我们看十几小时开车视频,就能上路处理从未见过的路况。而AI模型需要海量数据训练,在benchmark上分数很高,但遇到分布外的真实场景,就容易出错。
还有一个现象非常典型:用大模型去修复代码bug。模型给出修改方案,你告诉它“这个修复很好”。结果它修复了旧bug,却引入新bug。你再指出新bug,它认同你的说法,修改之后,又把最开始那个bug带回来了。
为什么会这样?模型没有内在的价值函数。它不知道自己的推理是对还是错。它不知道这个思路值不值得继续往下走。它只能根据人类或者外部打分器给出的反馈来学习。在没有外部奖励的时候,它没有办法自我评估、自我修正。
这就是离线学习的局限。预训练、强化学习,全部都是离线学习:在训练阶段一次性学完,训练结束,模型权重冻结。之后模型投入使用,不再学习。
人类不是这样。人类在推理、在解决问题的过程中,持续学习,持续评估自己做得好不好。
Dwarkesh:你提到价值函数,很多人会联想到人类的情绪。为什么情绪在这里这么关键?
Ilya Sutskever:这里有一个非常经典的神经科学案例,Damasio记录的病人Elliot。这个病人大脑腹内侧前额叶受损,失去了情绪感受能力。他的智力、逻辑、语言全部完好,智力测试分数正常,可以解数学题、做逻辑推理。
但是他的日常生活彻底崩溃了。他做不出任何决定。光是早上选穿哪一双袜子,就要花费好几个小时,反复权衡所有利弊,永远无法下判断。
这件事非常有启发性。很多人以为情绪是理性思考的干扰、噪音。但这个案例告诉我们:情绪不是理性的敌人,而是理性决策的必要组件。
情绪本质上就是进化内置在我们大脑里的价值函数。它可以快速给候选方案打分,快速把明显不好的选项过滤掉,避免无限穷举所有可能性。当信息不完备、时间有限的时候,它给我们一个方向。恐惧提醒危险;愉悦标记有益的行为;愤怒守护边界;同情支撑合作。
没有这个内置价值函数,纯逻辑推理会陷入无限循环,寸步难行。
外部奖励无法替代内在评估
Dwarkesh:那我们能不能直接给AI设计一个类似的价值函数?现在的RLHF、模型打分器不就是在做这件事吗?
Ilya Sutskever:当前的强化学习方法有个根本性短板:奖励信号只有在任务结束之后才能拿到。模型走完成千上万步推理,输出答案,才收到一个分数。在漫长的推理过程中间,没有任何训练信号。
想象下棋。如果只有对局结束,赢或者输才得到奖励,中间每一步都没有评估信号,学习会非常困难。而人类的价值函数可以在每一步中间给出信号:“这一步看起来不妙,这个方向值得继续。”
我们现在的模型缺少这种中间步骤的内在评估信号。外部打分器很脆弱,泛化能力差,而且依赖人工或者其他模型来生成,不是内置在系统内部。
这就是为什么现在模型可以在标准测试集表现很好,但面对陌生、全新的场景,很容易崩溃。它们缺少持续、在线、内置的自我评估能力。
Dwarkesh:那你设想的下一代AI系统,会是什么样?
Ilya Sutskever:它不是一个出厂就固化权重的静态模型。更像一个正在成长的少年。它拥有少量先天内置的归纳偏向、内置价值函数,然后在解决任务、推理的过程中持续学习。也就是在使用模型的时候,模型本身也在学习。
它的样本效率会接近人类。不需要海量预训练数据。遇到新任务,在推理过程中,一边思考一边学习,实时更新自己。
当然,我不会在这里把所有技术细节全部公开。但大方向就是:把学习过程从预训练阶段,延伸到推理、测试的阶段。
Dwarkesh:很多人会质疑,这种在线学习会不会带来安全风险?模型在使用中不断改变自己,会不会失控?
Ilya Sutskever:这是一个非常严肃的问题。任何可以在线更新自身权重的系统,安全边界都会更复杂。但安全不是靠冻结权重来解决的。冻结权重只是把风险转移到预训练阶段。静态模型依然会产生不可预期的行为、幻觉。
安全的核心,是理解智能系统内部的学习动态,保证它学习的目标稳定、对齐。我们需要研究如何约束在线学习的更新规则,保证它不会朝着有害方向漂移。
算力堆叠只剩边际收益
Dwarkesh:我们聊一下扩展的边界。你认为预训练的数据瓶颈会在什么时候到来?


