看了20万小时「人类干活实录」,机器人悟了量子位
刚刚,机器人圈公认最难的「家务大考」RoboCasa-365,榜首换人了。
新纪录62.6%,比之前的SOTA直接高出8.4个百分点。
要知道,这个榜上大部分模型还在50%以下挣扎。
更有意思的是,登顶的这个名字,之前几乎没人听说过:Riemann-1.0,黎曼动力。
一查,好家伙,首秀。这个模型才刚在WAIC 2026上正式发布。
跑分说明不了一切,我又去翻了它的真机视频。
随手点开一段机器人收拾餐桌的demo,只能说,榜单没骗人。
薄薄贴在桌面上的勺子,夹得起来;碗里剩的汤,知道先倒了再收;完事了还顺手把桌子擦干净。
(完了,估计连老妈以后的台词都要改了:连机器人都比你眼里有活儿~)
再往上扒,黎曼动力背后站着的是昆仑万维——前者正是昆仑万维专为具身智能方向成立的子公司。
一个新面孔,凭什么首秀就登顶?
答案藏在它的「食谱」里:23.2万小时训练数据中,占大头的根本不是机器人数据,是人的视频。
没错,人做饭、叠衣服、收拾桌子的第一视角视频。
造机器人大脑,行业吵出了新共识
为什么是「人的视频」?这还要从具身智能领域吵了一年多的路线之争说起。
VLA和世界模型,谁代表机器人的未来?行业曾为此分裂成鲜明两派。
两派各有优劣,为便于大家做对比,这里我直接放了一张AI生成的图表:
△图片由AI生成
简单总结就是,VLA属于「直觉派」,快但容易翻车;世界模型则属于「深思派」,稳但是又慢又贵。
吵着吵着大家发现:算了,既然各有优劣,那不如来一个取长补短?
于是,两条路线开始合流。
今年6月,英伟达西雅图机器人实验室发布了一篇长文综述,文章的核心判断是:
World Action Model(WAM,世界动作模型)已经从VLA研究里的小众分支,迅速长成了机器人基础模型的第二条主路线,而下一代机器人基础模型,大概率是两者的混合体。
△图源:英伟达官方技术博客
ICML 2026上,包括LeCun团队在内的多篇论文也在往同一个方向使劲:
从海量无标注的野外视频(in-the-wild videos)里学习潜在动作世界模型。
△图源:ICML官网
把这些工作放在一起看,一条正在被越来越多团队验证的训练范式浮出水面:
先用大规模开放世界视频做预训练,让模型看遍人类怎么和物理世界打交道,攒够物理直觉;再用少量真实机器人数据做动作对齐,把直觉翻译成可执行的控制信号。
这就解释了,为什么下一代机器人大脑,都盯上了「人的视频」。
对机器人来说,人类每天的生活就是一场不间断的操作示范。做饭、叠衣服、整理房间,这些第一视角视频里,藏着人类怎么感知环境、规划动作、处理意外的全部秘密。
而且这类数据要多少有多少,场景丰富,还在源源不断地增长。
实际上,行业里少部分前沿玩家已经看到了这点。比如Being-H0.7用了20万小时第一视角人类视频,Generalist AI的GEN-1更是砸了50万小时可穿戴设备采集的人类数据。
作为其中之一,Riemann-1.0的独特之处在于:
它是国内较早把这条范式完整工程化跑通的选手,从仿真Benchmark到真机均获得验证的那种。
而它之所以能跑通,关键在于解决了一个核心难题:人类视频里没有机器人动作标签。
没错,再漂亮的范式,也有自己的问题要解决。
人叠衣服的视频看得再多,机器人手臂该转多少度、夹爪该用多大力,视频里一个字都没写。
看得懂,做不出。
20万+小时人类干活的视频,怎么变成机器人手上的活儿?
这正是Riemann-1.0故事的起点。
23.2万小时视频,怎么变成机器人的手艺
Riemann-1.0,一款面向通用机器人操作的世界模型(World Action Model)。
从名字就能看出来,它正是前文说的「混合体」:
VLA的手它有(直接出动作),世界模型的脑它也有(预演世界演化),两派的活儿,一个模型全包了。


