中国版「生物DeepSeek」诞生新智元

8/4/2026

DeepSeek-V4-Flash正式版刚炸翻全球通用大模型圈,中国生命科学版Deepseek就紧随其后。

近日,津渡生科(由4个牛津大学归国学霸创办)自主研发的生命科学垂类GeneLLM多组学大模型,接连登上国际顶级学术期刊——《Nature Communications》与《Advanced Science》。

作为全球首个直接使用组学原始数据进行预训练的多组学大模型,GeneLLM是继谷歌AlphaFold和斯坦福大学的EVO 2之后的又一重磅模型,填补了中国生命科学基础大模型的空白,堪称中国生命科学版Deepseek,让AI开始理解生命的多个「语言」与整个「系统」。

像预测下一个token一样,预测下一条生命信息

疾病识别只是GeneLLM的一个应用场景,津渡生科真正想做的,是打造生命科学领域的「Claude Code」。

ChatGPT、Claude、DeepSeek等大语言模型的核心,是下一个token预测。

GeneLLM思路类似,但它预测的不是文字,而是生命信息。

RNA序列中的四种碱基——腺嘌呤(A)、尿嘧啶(U)、鸟嘌呤(G)、胞嘧啶(C),成为GeneLLM理解生命语言的基本Token。

传统生物信息学分析通常依赖基因注释、序列比对和人工定义标签。这种方法虽然准确,但会提前限定模型的认知范围,也可能丢失大量隐藏在原始数据中的未知生物信号。

GeneLLM则另辟蹊径,直接从未经加工的原始测序数据中学习生命规律。

它以RNA组、蛋白质组、代谢组等多组学原始数据作为训练数据,让模型自主发现疾病相关模式。

目前,GeneLLM已完成15亿参数和3.5万亿碱基序列的模型预训练,XLarge版本实现300亿参数模型预训练,持续扩大技术壁垒。

作为全球首个基于原始测序数据预训练的多组学大模型,GeneLLM包括两大阶段:

(1)无监督预训练与原型挖掘

(2)患者级疾病微调(Disease Tuning)

GeneLLM首先需要解决一个问题:

如何把复杂的生命数据变成AI可以理解的语言?

在自然语言处理中,BPE算法会把句子切分成Token;而GeneLLM则将约150bp长度的RNA测序片段,通过7个碱基组成的滑动窗口(7-mer)切分为生命Token。

随后,模型利用Transformer架构,在没有基因注释和人工标签的情况下,直接预测下一个碱基。

这意味着AI不是先看人类整理好的「字典」,而是直接从生命原始信号中学习。

在训练过程中,GeneLLM处理了约数十万亿条RNA reads,在百卡集群 NVIDIA A100 GPU上训练。

至此,GeneLLM泛化等能力开始「涌现」。

作为生科领域的重大创新突破,GeneLLM这一国产生科模型可以应用于新药研发、精准医疗、合成生物、环境监测、微生物与生物农业、蛋白质与分子设计等多个领域,是全球范围内少有实现实际场景落地的大模型。

当我们审视完GeneLLM在「数据、架构、训练」等底层创新后,才能真正理解:为何它代表了中国的「生物版DeepSeek」。

硅谷以数万张H100堆砌万亿参数,DeepSeek则以算法创新提高算力效率,GeneLLM同样四两拨千斤,撬动亿万生命科学数据。

如果说AlphaFold让AI第一次看懂生命的「结构」,EVO2让AI开始理解生命的「代码」,那么GeneLLM试图进一步理解生命的「系统」。

更狠的是效率。传统方法依赖6Gb深度测序,成本高企,难以落地。GeneLLM 在1Gb极浅深度(成本缩减83%)下仍保持AUC > 0.8。

这意味真正有希望让普惠精准医疗成为现实。

一种新的科研范式开始浮现:让AI从生命数据中学习,让生命科学进入可预测、可计算、可规模化探索的新阶段。

不只是模型,还是「最后一公里」的智能基础设施

但津渡生科的布局不仅在基础模型。

以GeneLLM多组学大模型为生命认知底座,津渡生科进一步构建连接AI智能与物理世界的执行体系,通过Harness智能实验执行层与DBTL(Design-Build-Test-Learn)数据闭环,实现从生命规律理解、科学假设生成,到自动化实验验证和持续迭代优化的完整AI for Science闭环。

正如前OpenAI VP、后训练负责人Liam Fedus所说,当前LLM已经耗尽了互联网上有限的文本和代码,下一步的科学发现的重大进展必须依赖实验迭代。

也就是说,不能只靠读人类已写下的内容来发现新知识,AI 必须自己做实验。

可问题来了——

互联网服务天生有API,网络信息天生是数字化的,但科研设备来自不同厂商,协议各不相同,既复杂又昂贵,没有人能在几个月内推倒重建。

Scroll for more