谷歌传奇Jeff Dean离职新智元

8/6/2026

AI圈迎来一场「大地震」!

今早,谷歌传奇大佬Jeff Dean一纸公告,告别效力了27年的谷歌。

几乎同一时间,他与三位顶尖老友一起打造的新公司——Discovery Loop,也正式浮出水面。

从名字就能看出,他们押注的,正是当下AI领域最火热的方向RSI(递归自我改进)。

让AI持续自我迭代、自我进化,并自动攻克机器学习、科学研究和工程技术领域的重要难题。

Discovery Loop所代表的,是一条越来越清晰的路线:用AI加速AI。

未来,AI将彻底告别单纯的「问答模式」,全盘接管「提出假设➔执行实验➔验证结论」的完整科研闭环。

而就在今天,中国队也下场了。

BigBang-V1首秀35B击败DeepSeek V4

由上海交通大学人工智能学院、深势科技、上海算法创新研究院组成的「无尽前沿团队」,已经把这条循环跑完了一整圈。

他们交出的,是第一个通过「原生RSI」方式,训练出来的全新基座大模型——BigBang-V1,总参数35B。

主页:https://endlessfrontier.tech/

论文:https://endlessfrontier.tech/assets/paper.pdf

模型:https://huggingface.co/endless-frontier

以可验证前沿任务为牵引,它用了100%纯AI合成的数据,便实现了性能大爆炸。

在35B级别的测评中,BigBang-V1一口气狂揽十项第一。

在OpenAI提出的高难度科学基准FrontierScience Research上,它拿到46.2分,击败了DeepSeek V4 Pro。

35B硬刚1.6T,在45倍的体量悬殊之下,BigBang-V1完美诠释了什么是真正的「以小博大」。

它在各大高难度榜单的战绩,也同样堪称硬核:

在Humanity's Last Exam (人类最后考试)基准上,BigBang斩获50.3分,击败V4 Pro,堪比Gemini 3.1 Pro。

这是一个测试大模型综合推理能力的基准,由Scale AI在Nature正刊上提出。

在OpenAI提出的PaperBench (Code-Dev)上,BigBang跑出了53.6,V4 Pro仅为50.4。它主要考的是大模型复现AI学术论文的能力。

另一个OpenAI提出,考察模型自主完成AI工程能力的基准MLE-Bench (Lite)上,BigBang亦交出了59.1分的亮眼答卷。

不仅如此,它还在更高难度的BioMysteryBench Human-Difficult上,取得了15.7分,V4 Pro为13.7分。

这是Anthropic迄今推出的唯一一项基准测试,主要考察大模型解决生物信息学研究问题的能力——

给模型一堆带噪声的测序数据,要它分析出一个精确、且符合评分标准的生物学结论。

技术报告里的几个具体案例,更能看清BigBang的优势在哪。

第一个现场:找病毒。

就以BioMysteryBench评测中,一道生物学题目为例——

三份人体肠道类器官的测序原始数据摆在面前,模型要判断感染的是哪种RNA病毒。

BigBang连跑三次,答案完全一致:诺如病毒GII.4,3/3全对。

DeepSeek V4 Flash呢?三次给了三种毫不相干的病毒,而且没一个沾边的。

第二个现场:复现论文,还挑出了错。

这次换了个活儿——复现。照着一篇论文,把它的方法原样实现出来。

结果BigBang读到一半就觉得不对劲。跑了几个测试一看,问题出在论文自己身上:核心设定有矛盾。

有个关键量被固定住了,这么一来,论文说能做到的「子集不断缩小」就根本发生不了。

于是,BigBang直接动手改了这处设计,让子集大小能真正变化,还顺带修好了一个梯度中断的问题。复现最后拿到0.7657。

相比之下,DeepSeek V4 Flash只做了语法检查,看代码能启动就交卷了,实际一次都没运行。最终结果只有0.3053。

把多个开源模型串成一条抗体设计流水线

单独的题看得差不多了。这次咱们上点狠的,直接甩给它一个真活儿:设计一款抗体。

BigBang的解法,是把它拆成一条流水线,让好几个开源模型接力干。

首先,用开源的蛋白质设计模型生成一批抗体候选,按规则筛掉一批。

然后把留下的交给AlphaFold,预测抗体与靶标的复合物结构,再用结构置信度和界面指标,评估结构是否稳定、结合是否合理。不达标的就直接淘汰,或者退回上一步重做。

过了AlphaFold这关,候选还要进一个开源的物理打分器,评估界面能量、原子冲突这些指标。

关键在于,这两步用的是两套完全独立的计算方法。只有它们的结论对得上,候选才留得下来。

当然话得说回来,这些还只是算出来的候选,不代表抗体真能用,最后还得靠实验去验。

设计出来的样例分子

看到这儿,你一定会忍不住追问:一个仅有35B参数的模型,凭什么拥有如此强悍的战斗力?

答案,就藏在它背后的「原生RSI」训练方式中。

令人震撼的是,BigBang使用的各学科前沿科研的数据,100%由AI合成。

Scroll for more