硅谷百亿美金押注「AI造AI」新智元
2026年,AI行业最昂贵的新故事,已经不只是「训练一个更大的模型」。
资本开始直接押注:让AI参与制造下一代AI。
4月,AlphaGo核心缔造者David Silver创办的 Ineffable Intelligence完成11亿美元融资、估值51亿美元。它要打造的不是另一个Chatbot,而是一个依靠强化学习和自身经验发现知识的「超级学习者」。
5月,Richard Socher、Peter Norvig等人创办的Recursive Superintelligence带着6.5亿美元融资亮相,目标直接写进公司名字:构建能够发现自身弱点、重新设计并改进自己的AI。
更早之前,AlphaChip联合创造者创办的Ricursive Intelligence在成立不到两个月后完成3亿美元A轮、估值40亿美元。它试图关闭一条真实的物理递归链:AI设计更好的芯片,更好的芯片再加速下一代AI。
另一边,Periodic Labs以3亿美元种子轮起步,建设AI科学家和供其行动的自动化实验室;Sakana AI完成2亿美元B轮、估值27亿美元后,又成立RSI Lab,把AI Scientist、自进化程序和Agent-Native Model接进同一条递归路线。其端到端自动化AI研究成果已于2026年3月正式发表于《Nature》。
仅上述已披露案例,融资金额已超过25亿美元,相关公司的已披露估值合计超过100亿美元。
这些公司技术不同、边界不同,甚至对「自我改进」的定义也不同。
但资本正在为同一个函数定价:
AI能力 → 自动实验 → 可验证结果 → 更强AI。
过去,AI公司的估值锚点是模型能力和用户规模。现在,一个新的变量正在进入定价模型:能力提升的速度,能否被系统自身持续加速。
RSI不再只是科幻
前沿实验室已经在自己的
研发线上看到它
Recursive Self-Improvement(RSI),递归自我改进,曾经更像一个关于「智能爆炸」的思想实验。
如今,它开始获得真实的生产数据。
Anthropic在《When AI builds itself》中披露,截至2026年5月,Claude贡献了其代码库中超过80%的合入代码,工程师日均合入量约为2024年的8倍;在小模型训练代码优化测试中,模型实现的加速也在一年内从约3倍升至约52倍。
OpenAI也在GPT‑5.6发布说明中直接引入RSI指标。研究人员已让模型参与故障诊断、训练系统优化、实验运行与结果分析;在衡量AI研发和模型优化能力的RSI Index上,GPT‑5.6 Sol较GPT‑5.5提升16.2个百分点。
这仍不是完整RSI。Anthropic称RSI尚未到来,OpenAI也仅称指标衡量「向RSI迈进的进展」。但趋势清楚:AI正从写代码的助手,走向执行实验、处理反馈并加速下一轮AI研发。
这正是RSI受到投资行业追捧的根本原因:一旦AI能够有效提升AI研发效率,今天的能力进步会加速明天的能力进步;研发效率不再线性增长,而可能形成复利。
AI4AI、Meta-Evolution和RSI,不是同一个概念
图1:AI4AI定义优化对象,Meta-Evolution描述经验反哺「改进者」的机制,RSI则要求更强的跨代递归闭环
热度越高,越需要把边界说清楚。
AI4AI(AI for AI)描述的是工作对象:让AI参与创造和优化AI。它可以写训练代码、改模型结构、搜索算法、优化Agent Harness,也可以设计承载AI的芯片。
Evolution 描述的是一次运行内的优化过程:AI根据反馈反复修改候选程序或系统,把当前方案变得更好。
Meta-Evolution 进一步改变了学习对象:系统不只保留最终产物,还把进化轨迹用于训练,让那个负责提出改进的模型本身变强。
RSI 则要求更强的跨代闭环:升级后的AI能够继续改进制造下一代AI的过程,并让这种能力跨代持续增强。
可以把三者的关系压缩成一句话:
AI4AI 回答「谁来做AI研发」;Meta-Evolution 回答「怎样让改进者本身变强」;RSI 追问「变强的改进者,能否继续制造更强的下一代」。
因此,不是所有AI4AI都是RSI,多跑几轮Agent也不是RSI。
从一次自动化实验,到真正的递归自我改进,中间缺少的是一套可执行、可验证、能够把经验送回模型的工程闭环。
这正是衔远科技 Frontis-MA 元智能体系列模型试图补上的位置。Frontis-MA1 此前已于 WAIC 2026首次亮相,衔远科技与清华大学团队持续推进模型训练与系统迭代,短短两周内,Frontis-MA1及其进化搜索性能继续提升。
本次,团队正式发布技术报告 《Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering》,通过元进化工作流训练且面向机器学习工程的元智能体 Frontis-MA1-35B 模型权重,以及贯通可扩展任务环境、强化学习训练与进化推理的全栈开源套件 OpenMLE。
先看最硬的结果:
同一推理框架下,Frontis-MA1-35B 将基座模型在 OpenAI 发布的 MLE-Bench Lite 上的平均奖牌率从 39.39%推高到 60.61%,绝对提升 21.22 个百分点;
加入跨任务先验与异步多GPU搜索后,Frontis-MA1-35B 与 OpenMLE-Evo-Max 增强进化框架组成的系统达到 71.21% 平均奖牌率、0.8126 人类排名,22个任务全部形成有效提交;
与原始 AIRA-Evo 相比,OpenMLE-Evo 让总模型Token下降 41.7%,每百万 Token找到「新最优」的效率反而提高 84.3%;
在 NatureBench Lite 的10项科学任务上,Frontis-MA1-35B 结合 OpenMLE-Evo,3项超越论文SOTA,7项达到论文SOTA。
图2|Frontis-MA1-35B + OpenMLE-Evo-Max达到71.21%。橙色实心部分是标准OpenMLE-Evo下的60.61%,斜线部分是Evo-Max带来的增益。右图比较模型总参数量与成绩。
如果只把它理解成一次Benchmark刷榜,就低估了这项工作的野心。
Frontis-MA1真正押注的是一个更大的范式变化:
今天的大模型交付一份智力快照;未来的AI系统交付一条持续上升的能力曲线。
而决定曲线斜率的,不只是模型有多大,而是系统能否把每次行动的结果,变成下一次改进的资本。
不是再造一个程序员,而是训练一个AI研发者
Coding Agent 解决的是一个相对确定的问题:需求已经给定,代码能否通过测试。
机器学习工程Agent面对的,则是一片没有标准答案的实验场。
假设一家银行希望提升欺诈识别模型。Agent拿到的是数据、指标、计算预算和合规边界,而不是一张写着正确答案的试卷。它要检查数据泄漏,选择验证策略,处理类别不平衡,比较不同模型,启动训练,分析错误,再决定下一轮是调整特征、改损失函数,还是融合两条路线。
一份程序能跑,只意味着拿到了入场券。
真正的目标是,在有限时间和算力内,把一个0.71分的有效方案,持续推向0.75、0.80,直到逼近甚至超过人类专家管线。
这类Agent有四个鲜明特征:
必须动手。 它不只输出建议,还要写代码、训练模型并提交结果;
必须等待。 一次行动可能数十分钟后才返回反馈,甚至只返回一个失败;
必须竞争。 「正确」远远不够,它需要在连续指标上寻找更优解;
必须继承。 它要知道哪些改动真正有效,哪些失败值得记住,哪些路线可以组合。
如果说 Coding Agent 是在替人写代码,机器学习工程Agent是在替人进行一部分研究与工程决策。
这正是 AI for AI 最具体、也最残酷的试验场:AI不再谈论如何改进AI,它必须在真实执行中把AI改得更好。
从这个意义上说,Frontis-MA1 也体现了衔远创始人周伯文教授长期强调的 「通专融合」:它不从零训练另一个通用大模型,而是以 Qwen3.6-35B-A3B 的通用推理、编程与机器学习知识为起点,再通过专业任务环境、可验证反馈、后训练和进化搜索,把通用能力转化为机器学习工程能力。
自我反思不等于自我进化
今天的Agent很会「反思」。
它可以在一段文字里解释自己错在哪里,再生成一份看起来更周全的答案。但如果代码没有运行、模型没有训练、指标没有变化,这种反思没有支付任何现实成本,也没有通过现实检验。
没有可执行反馈,就没有进化,只有自我叙事。
机器学习工程尤其不相信语言上的自信。一次看似聪明的修改,可能导致数据泄漏;一套更复杂的模型,可能在小数据上严重过拟合;一条理论上优雅的管线,可能连显存都装不下。
OpenMLE 首先做的,不是让模型「想得更久」,而是为它建造一个无法糊弄的世界。
环境层 OpenMLE-Gym 将异构机器学习任务封装成统一的可执行任务包。公开输入与隐藏答案隔离,Agent提交的程序必须进入沙箱真实运行,再由任务内评测器给出分数。
图3|约1.1万个Kaggle竞赛经过许可、可执行性和语义质量检查,最终留下2,240个竞赛任务。右侧是统一后的任务目录。
技术报告显示,OpenMLE-Gym包含 5,758个可执行任务:156个精选锚点任务、3,362个Kaggle数据集任务和2,240个Kaggle竞赛任务。
这5,758个任务并不只是一批数据。
它们是一座「经验工厂」:模型的每次判断都必须变成行动,每次行动都留下结果,每个结果都可能成为后续模型训练的信号。
从任务、训练到搜索:OpenMLE把三个断点接起来
图:OpenMLE-Gym、OpenMLE-ERL与OpenMLE-Evo构成从执行反馈、操作学习到长时程搜索的完整技术栈


