AGI新战场,杀出个中国LimiX-2赢了又赢

量子位 · 经八阕原文

这两年,AI赛道越来越热。

大语言模型LLM(Large Language Model)在卷得飞起的同时——

另一条结构化数据侧的AI路线LDM,也突然开始涌进各类型头部玩家。

LDM(Large Data Model),即结构化数据基础模型,其瞄准的是生产侧的核心痛点:即如何让基础模型直接学习不同结构化数据中的变量关系、条件关系和生成机制。

到底有多火呢,这么说吧!

像咱熟悉的美国Google、Amazon,德国企业软件巨头SAP等玩家纷纷下场布局~

不过,谁成想呢,巨头们刚涌进LDM抢位,一支中国团队已经先把榜首坐成了「固定席位」。

9月15日,德国软件巨头SAP抢发TabPFN-3.5,几小时后(9月16日),一支由清华博士组成的团队,用一个400M参数的结构化数据基础模型——

直接拿下了TabArena、TALENT、BCCO三个国际主流基准测试中二分类、多分类、回归等各项任务的「第一」,呈现断层领先:

△官方TabArena榜单

不卖关子,这个把谷歌等一众大厂按在地上摩擦的,就是「稳准智能」刚刚发布的:LimiX-2。

值得一提的是,这也不是稳准智能第一次把LDM做到国际头部了。

去年他们发布的国内首个结构化数据基础模型LimiX已经上演过很长一段时间的霸榜大戏,但此后团队也没有追着榜单追赶,而是继续往底层技术和模型储备里扎。

然后这次,直接给海内外主流选手再来了个措手不及~

在这家中国团队看来,真正重要的,从来不是拿下一次第一,而是每到关键节点,都有能力重新回到第一。

而作为国内首个结构化数据通用大模型,LimiX啃下的,正是数据背后最值钱也最难找的「因果规律」。

相比TabPFN这类偏目标预测的行级建模路线,LimiX-2把面向变量关系建模前置为核心目标,学习跨变量、跨样本的联合依赖结构。

此外,其还自建了一套高质量自动化数据合成引擎,先让模型见过足够复杂的数据世界,再去处理真实任务。

过去几年,LLM已经吃透了文本、语音、视频,但一碰到工业生产、科学研究等应用侧真正拿来做决策的场景,对因果关系、准确性和稳定性的要求会陡然提高,这也让LDM的价值开始越来越清晰。

当前就在这条越来越热的赛道中,稳准智能联合清华已然率先把成果跑进了行业头部位置。

LLM啃不动的数据分析硬骨头,LDM开始接手了

大语言模型,这两年能力边界一路狂飙。

但热闹归热闹,随着AI真正往产业深处走,一个此前很容易被模型能力增长掩盖的问题,也开始变得越来越清晰——

那就是现实世界,远比语言世界「更大」。

要知道今天的大语言模型能力,很大程度上建立在一个极其庞大的语义世界之上。

文本、代码、论文、数学公式,甚至经过标注和描述的图像、视频,其中承载的知识都有一个共同特点,那就是它们已经经过了人类的一次理解、筛选和抽象。

LLM做的事情,就是把这些已经进入人类知识体系的信息编码成Token,通过海量语料学习上下文关系,再进一步形成知识、推理和生成能力。

所以从信息论和建模对象来看,LLM所处理的,更多是已经完成「语义化」的现实。

但问题是,在产业系统里,另一类数据是长期存在于这个语义层「之外」的。

以制造业为例,温度、压力、转速、原料配比、设备状态、能耗等几十、几百甚至上千个变量会同时变化,共同构成一个持续演化的高维数据空间。

其中大量关键规律,可能并没有被人类提前总结成规则、公式或文本知识。

更重要的是,产业真正关心的,往往也不是单个变量是什么,而是变量之间存在什么稳定关系,哪些关系可以跨环境成立,以及一个变量变化之后,系统整体会如何响应。

如果先把这类数据转写成文本,再交给LLM处理,中间天然会经历一次「信息压缩」。

但在生产系统中,那些被压缩掉的细粒度差异,恰恰可能直接决定预测精度、良率和风险判断,在语义空间里看似可以忽略的信息,到了生产空间里可能恰恰是最值钱的信息。

这恰恰构成了「结构化数据建模」与「语言建模」之间最本质的差异——

如果说LLM主要学习人类已经表达出来的世界,那么LDM更希望直接进入真实世界留下的高维数据空间,从变量关系本身出发理解规律。

二者面对的是不同的信息空间,也因此更接近两条平行、互补的基础模型路线~

能往生产深处扎,也能补足LLM对真实数据世界理解不足的那一块儿缺口,确实有前景啊。。。

随着AI越来越多进入复杂决策场景,LDM也正成为基础模型体系中越来越重要的一块能力拼图。

于是乎,这两年,海内外玩家也开始接连入场,结构化数据基础模型的竞争,正在明显《提速》。

今年Google直接发布TabFM,把表格数据基础模型正式纳入自己的Foundation Model版图。

Amazon也推出Mitra,专门探索一个预训练模型如何跨不同表格、不同任务直接迁移。

SAP动作更猛,先做SAP-RPT-1,今年又直接收购TabPFN背后的Prior Labs,投入超过10亿欧元扩建结构化数据AI研究团队。

就在几天前,最新的TabPFN-3.5 Plus又正式进入SAP AI Core,直接开始做现金流预测、付款延迟、供应商风险、客户流失这些企业核心决策任务。

从Google、Amazon一路到SAP,结构化数据基础模型已经从学术圈里的新方向,迅速变成全球科技巨头集体押注的一块基础能力。

重做底层技术范式,LimiX让模型理解数据背后的因果机制

LDM赛道开始升温,崔鹏和团队多年押注的方向,也终于走到聚光灯下。

稳准智能首席科学家、清华大学计算机系崔鹏教授,长期研究结构化数据与因果智能,也是LDM理念的提出者之一。

很长一段时间里,这支团队都在啃一些更底层的问题:Scaling规律能否延伸到结构化数据,CMNs能否进一步打开因果建模的能力上限。

这些偏离传统因果研究路径的探索,当时并不轻松。

如今,LimiX、LimiX-2连续冲上国际Benchmark前列,也让这条当初看起来更冒险的技术路线,开始得到模型效果的直接验证。

跟赛道升温相比,一个更值得注意的变化是:大家底层技术其实并不那么一样。

比如TabPFN为代表的PFN路线,核心目标很明确:给定上下文和目标,让模型快速适应一张新表,并把Y预测准。

这条路线非常适合分类、回归等任务,也推动了Tabular Foundation Model快速发展。

但当结构化数据模型继续往更深处走,一个问题开始冒出来:如果我们想知道的,已经不止是「Y等于多少」呢?

毕竟生产侧真正关心的,往往还包括变量之间是什么关系,一个变量发生变化之后,其他变量会怎么动。

到了这一步,传统以目标变量为中心的PFN路线,其能力边界就逐渐显出来了——

对于不少PFN类模型而言,数据通常会先被压缩成更高层的表示,再用于完成目标预测,这样做有利于快速适配任务,但问题是部分变量级的细粒度信息,也可能在表示过程中被折叠。

当问题继续从「预测结果」往「理解变量关系」推进时,模型需要保留和利用的信息粒度,也随之发生变化!!

而稳准智能这次在LimiX-2上真正动刀的,则是结构化数据模型最底层的「技术范式」。

作为较早用机器学习方法研究变量关系和因果规律的团队之一,崔鹏团队长期关注的问题,就是如何让模型超越表面相关性,找到那些跨环境依然稳定的关系。

因此到了LimiX-2,稳准没有继续沿着传统预测范式往上堆能力,而是直接改了模型「学什么」——

团队创造性提出上下文机制网络Contextual Mechanism Networks(CMNs),把结构化数据建模从以目标变量为中心的预测问题,推进为面向全变量联合依赖和数据生成机制的关系建模问题。

先来说说上下文机制网络(CMNs)。

如果说PFN仍然是在给定目标下学习怎么预测得更准,那么CMNs想回答的问题,已经变成了X、Y和其他变量放在一起,到底是怎么共同构成这份数据的。

换句话说,LimiX-2没再把变量关系当成服务于预测的中间信息,而是直接把它变成模型要学习的核心对象。

这种底层范式的切换有点类似大语言模型从BERT走向GPT,真正变化的核心,不只体现在参数规模和Benchmark上,更在于模型学习目标和组织信息的方式被重新定义了。

当然,CMNs这个新的学习目标,听起来很理想,真正做起来却没那么简单。

既然想让模型搞清楚变量之间到底是什么关系,训练时就不能永远给它一道「固定」的题。

所以稳准团队联合清华在LimiX-2做的一件重要的事,便是通过提出上下文条件掩码建模(CCMM),并升级自动化合成数据的生成引擎,不断给模型换题——

通过不断遮住-预测不同变量,逼着模型从预测单一目标,转向学习变量之间的条件依赖和联合结构。

反复训练后,模型掌握的也就不只是某一道题怎么答,而是逐渐理解:这些变量彼此如何作用。

预测目标不断变化,模型也就没法只围着某一个Y死磕,而得慢慢把整张表里变量之间的关系摸清楚。

来源:量子位(经八阕转载) · 查看原文
Scroll for more