世界模型有触觉了量子位

7/30/2026

刚刚,BeingBeyond智在无界发布首个基于人类视频数据的隐式触觉世界动作模型——Being-H0.8。

作为一套带有触觉的隐式世界—动作模型,Being-H0.8在预训练阶段就教会机器人提前判断将要怎样接触物体,并在真正接触后,根据触觉反馈及时调整动作。

相比于过去根据画面决定做什么动作的世界模型,Being-H0.8这次把触觉放进了“预测—执行—反馈”的完整链路:

模型先根据当前画面,预判接下来可能发生的接触,执行过程中再读取最新触觉,重新生成下一小段动作。

具体来说,为了实现这一点,Being-H0.8从数据、模型和控制三层同时入手:

数据:汇总数十家合作伙伴的数据,建立超过50万小时的原始数据池,形成高质量数据集UniHand-3.0 ,并通过TactoHand生成接触和邻近度标注。

模型:预训练时,把动作执行后实际记录到的视觉和触觉结果作为监督,让模型学习仅凭当前指令和画面,提前判断接下来会怎样接触。

控制:每个动作块开始时,模型先生成完整动作计划;每执行一小段,就读取最新机器人状态和触觉,只重算下一小段动作。

基于这套方法,Being-H0.8在真实双臂机器人实验中,完成了包中取物、毛笔写字、挤牙膏、夹薯片等依赖触觉的高难度精巧任务。

首个基于人类视频数据的隐式触觉世界动作模型

要说Being-H0.8这次最值得关注的亮点,当属创新的隐式触觉世界动作模型架构和超50万小时的超大数据集了,咱们先来看模型层面。

对于具身模型而言,触觉不仅关系到精细操作,还能帮助它完成仅凭视觉难以实现的接触推断。

因此,过去两年,围绕触觉如何赋能具身基础模型,学界已经涌现出不少探索,李飞飞、徐丹飞、Wenzhen Yuan、宋舒然等研究者也都在推进相关方向。

但如果我们把问题进一步聚焦到世界模型,就会发现:触觉究竟该如何进入世界模型,仍然是一个开放问题。

一方面,现有的世界模型大多以视觉为核心。它们可以看到物体如何移动、形变,却很难准确判断接触是否发生、接触发生在哪里,以及物体正在承受怎样的作用力。

另一方面,触觉传感器虽种类繁多,但数据形态和表征方式并不统一。更现实的问题是,绝大多数大规模人类视频和机器人数据集,本身就没有同步记录触觉信息。

这就意味着,想要训练一个具备触觉能力的世界模型,不仅缺少统一的触觉表征,也缺少能够规模化获取的训练数据。

Being-H0.8正是智在无界针对这一问题给出的解法。

Being-H0.8在Being-H0.7隐式世界—动作模型的基础上,首次把触觉模态纳入隐空间表示中,将原本以视觉预测为主的建模方式,进一步扩展为隐式触觉世界—动作模型(Latent Tactile World-Action Model),把触觉预训练扩展到可规模化的第一视角人类视频数据。

这里的关键在于,Being-H0.8并不试图在像素层面完整重建未来画面,而是在隐空间中预测与任务真正相关的交互后果,例如是否发生接触、接触可能带来怎样的状态变化,并利用预测出的潜在状态进一步调节动作生成。

换句话说,Being-H0.8试图让机器人不只“看到”接下来会发生什么,还能从没有显式触觉标注的人类视频中,学习对接触与受力结果的隐式判断。

具体的,Being-H0.8由四个核心模块组成:负责预测交互后果的Mixture of Transformers (MoT)、负责执行与实时调整的慢—快动作专家、负责统一触觉输入的通用触觉编码器,以及负责统一动作空间的TopoHand。

其中,通用触觉编码器首先将不同传感器采集到的触觉信号,转换为统一的触觉token,从而降低不同设备、不同数据形态之间的差异。

而慢—快动作专家,则负责兼顾推理效率与接触反馈。

慢速流缓存视觉、语言和隐世界状态等计算成本更高的上下文,负责维持整体任务与动作计划;

快速流则在动作执行过程中,读取最新状态和触觉反馈,只重新生成接下来的一小段动作。

这样一来,机器人不必每次接收到触觉变化都重新计算完整计划,也能根据滑动、受力变化或接触偏移及时调整动作。

在训练阶段,未来时刻的触觉token会进入MoT的后验分支,帮助模型理解真实接触发生后,世界状态会如何变化。

到了部署阶段,MoT负责提前预测交互后果,慢速流维持整体上下文,快速流则根据最新触觉实时纠偏。

由此,触觉不再只是动作完成后的附加反馈,而是同时进入了机器人的“预测、执行与调整”过程。

超过50万小时的数据池

聊完模型,一个很自然的问题是:那训练模型的数据从哪里来呢?

这就要进入Being-H0.8的另一项关键工作——数据。

作为国内最早一批利用大规模人类视频预训练具身基础模型的企业之一,智在无界一直沿着人类视频预训练这条路线持续积累数据,并将其用于具身基础模型训练。

Being-H0.8的数据底座,正是这条路线长期积累的结果。

历经Being-H0到Being-H0.8的持续迭代,智在无界已汇聚了超过500,000小时的第一人称视频数据,并与数十家数据供应商开展合作。

这些视频数据覆盖自然物体交互、长时程任务、丰富手部动作与多样场景,为具身模型提供大规模人类交互经验。

据智在无界团队介绍,这也是目前国内规模最大的人类操作视频数据池。

但50万小时原始视频,并不等于50万小时可以直接用于训练的数据。

这些视频中混有大量看不到手、缺少有效操作、镜头剧烈抖动、与桌面物体交互无关或内容高度重复的片段;不同数据源在场景、任务、视角和动作分布上,也存在明显差异。

为此,团队搭建了一套面向数十万小时视频的数据处理管线,对原始数据进行过滤、去重、切分、语言标注和分布再平衡。

首先,团队会剔除无效片段,并将长视频切分为连续的短片段,再为其补充细粒度语言描述。

不过,只有画面和文字还不够。

具身模型不仅要知道画面中发生了什么,还要知道人的手处于什么状态、执行了怎样的动作。

对于缺少准确动作标注的人类视频,团队使用MANO统一表示手部状态,通过HMR(hand motion refinement,HMR)恢复和细化裸手运动轨迹,再利用Caliball补齐缺失的相机参数,从视频中进一步恢复出可用于学习的手部动作信息。

对于机器人数据,团队重新整理了规范化URDF,并统一关节约定、相机坐标系和手腕位姿表示,再针对各个数据集完成校准、同步和验证。

此外,团队还会逐项检查数据完整性、运动学一致性、跨模态同步情况,以及语言描述与视频内容是否匹配。

经过过滤、重建和标准化后,来自不同来源的人类视频与机器人轨迹,才被整理为相对统一的数据格式,最终形成UniHand3.0训练数据。

不过,到这里,这套数据仍然缺少最关键的一环——触觉。

把没有触觉的视频,变成可训练的触觉数据

经过前面的清洗、重建和标准化,模型虽然获得了大规模操作数据,却依然无法直接知道:接触发生在哪里、力度如何变化,以及物体在接触后产生了怎样的反馈。

Being-H0.8接下来的工作,就是把这些原本没有触觉记录的视频,转化为可以参与模型训练的触觉数据。

整套pipeline可以分成四步:

第一步,利用TactoHand从普通人类视频中恢复接触位置和邻近关系。

第二步,引入压力手套等真实传感器数据,为视觉推断补充物理压力信息。

第三步,通过通用触觉编码器,将不同来源、不同粒度的触觉信号统一成固定格式的触觉token。

第四步,利用TopoHand对齐人手、灵巧手和平行夹爪的结构与动作空间。

沿着这条路径,没有显式触觉记录的人类视频,最终被转换成了能够进入世界模型的统一触觉与动作表征。

第一步:从视频中恢复接触

Being-H0.8首先提出了TactoHand,用于从无触觉标注的人类视频中预测稠密的伪触觉监督,从而解决大规模人类视频普遍缺少触觉信号的问题。

TactoHand的核心思路是,不要求每段人类视频都同步采集真实触觉,而是先利用手与物体之间的三维几何关系,推断接触是否发生。

在带有三维标注的数据中,系统可以获得已经配准的手部网格和物体网格。通过计算手部顶点与物体表面的距离,并结合二者表面方向,TactoHand可以判断手部不同位置是否与物体发生接触。

Scroll for more