万字拆解RSI:人类造出的最后一个AI
2026 年 9 月,上海交通大学 Theseus Lab 联合字节跳动、 ModelBest 、智源、 XiongAnshou 、 Humanlaya 、 Agent-Native Research Lab 与上海人工智能实验室,挂出一篇 70 页的综述:《 The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement 》。
标题本身就是一个思想实验:如果存在"最后一个由人类亲手建造的 AI",那它之后的 AI ,是谁造的?这篇论文的回答是——递归自我改进( Recursive Self-Improvement, RSI )。
一、开发流水线先撑不住了:这不是科幻,是账单
先看三组数字,全部来自论文引言:
•Kimi K3 与 Qwen3.8-Max 分别装载 2.8 万亿 / 2.4 万亿参数,上下文窗口约 100 万 token ;
•在 GPT-5.6 发布前的六个月里, OpenAI 报告用于内部 coding 推理的算力扩张约 100 倍、内部 agentic 工具使用增长约 22 倍,活跃研究员的日均产出 token 达到 GPT-5.5 时期峰值的 2 倍;
模型训练本身仍然昂贵: Kimi K3 激活了 896 个专家中的 16 个,相比 K2 把稀疏激活的扩展效率提升了约 2.5 倍; NVIDIA Nemotron-4 的模型蒸馏用了 40 万条合成样本; OpenAI GPT-5.5 的数据质量团队动用了约 1320 名专业标注员、合计约 9240 人时。
更棘手的是部署之后的持续适配: Anthropic 报告 agentic 工作负载的 token 用量约为普通 chat 的 4 倍,到 multi-agent 系统因更长上下文、协调与端到端验证,这一倍数升至约 15 ; Meta 的 FBDetect 每周发现数千个基础设施回归,诊断一次约耗工程师 10 人时。
论文的判断很直接:靠人类写 SOP 、人类排实验、人类审回归的模式,正在从"可行"变成"瓶颈"。 RSI 要解决的,不是"让 AI 更聪明"这种老命题,而是——
能不能把"协调改进过程"本身,变成 AI 的一个持久能力?
二、 RSI 到底是什么:改进环九件套
论文把 RSI 定义为:
AI 通过与任务、环境或其他智能体持续交互,自主地把经验与反馈转化为对自身的持久修改;并且这些修改本身会影响后续改进的产生、评估与巩固。
这个定义里有三个关键词:自主、持久、被自身改进。前两个词不算新鲜——持续学习也能把新任务的知识写进模型; Agentic AI 也能自己跑实验。真正把 RSI 与邻居划开的,是第三个词。
为了把"改了什么、留下什么、谁说了算"讲清楚,论文把任何一次自我改进拆成一个改进环( improvement loop ),九件套:
九件套只问三个问题:环在哪里合上?什么被持久化、传给下一轮?改进过程中的哪些决定,仍然握在人类手里?
这把尺子贯穿全文。后面我们会看到,所谓"B0 到 L5",本质就是这三个问题的答案逐级从人手里移到 AI 手里。
三、一把新尺子: HCI 与四个公式
要谈"AI 还剩多少没搞定",论文拒绝沿用绝对分数,而是提出 Headroom-Closed Index ( HCI ,剩余闭合指数)。它的设计哲学是:不要问模型考了多少分,问它从"这一年这个 benchmark 的入门水平"爬到"满分"还有多远。
3.1 多源加权共识
它的意思是:剩余空间越大的领域, RSI 能带来的延伸越多。
▲ 论文 Figure 3 :实线为 2023–2026 实测的各领域 HCI 前沿轨迹;右侧虚线区是论文示意的"RSI 介入后"的延伸。注意软件工程(红)与工具/终端(金)两条线在 2025–2026 明显变平——这正是 RSI 最有价值的地方。
三条观察支撑了后续整本书:
1.知识类领域先接近天花板: 2026 年数学与研究生科学前沿 HCI 已到 86.4 / 85.8 ,知识前沿 77.2 ;
2.交互型任务剩余空间最大:软件工程只有 52.6 、搜索 56.8 、工具 agent 39.9——这些任务需要多步规划、环境状态跟踪、工具选择与自我解释,模型在 2024 年后并未把校内做题的能力均匀迁移过来;
3.剩余空间本身就是 RSI 的价值坐标:按式 (4),软件工程从 52.6 延伸到约 98.2 ,网络安全从 91.9 延伸到 98.2——RSI 最该发力的,正是那些"做一道题没用,得把整个工作流改对"的领域。
四、与邻居划清界限: RSI ≠ 持续学习 ≠ AutoML ≠ Agentic AI
自我改进这个词被用得太滥,论文专门拉了一张表,把 RSI 与三个常被混淆的范式放在九个维度上对比。
Table 1: RSI 与相邻范式对比
▲ 论文 Table 1 :✓ 主要核心目标,◯ 次要支撑角色,✕ 不在其范围。一眼看出:只有 RSI 把"机制修订"和"机制复用"同时打勾。


