我只想说,AI在物理世界都快卷疯了量子位

7/19/2026

太!火!爆!了!

还得是WAIC,还得是AI圈春晚——

哪怕到了展会第三天,依旧人挤人人人人,火爆热程度堪比上海这两天的天气。(doge)

甚至,据说,连黄牛票…都炒到3000块钱一张了!?

真不怪大家这么热情,主要吧,还是展会现场太有看头了——

这边机器人模拟药房拿药取药、那边机器人组团开演奏会,还有各种长进真实硬件里的Agent和操作系统。

具身智能、世界模型、AI Coding、Token经济、AI硬件……过去一年最火的技术概念,今年几乎全都被搬到了现场。

如果说去年逛展大家聊得更多的,还是AI还能做点啥,那到了今年,一个非常非常非常明显的变化是——

AI已经从屏幕里走了出来,开始往工厂、家庭、药房、穿戴设备和各种真实生产场景里「疯狂流动」了:

在一众展商中,我也看到了一个咱非常之熟悉的玩家:京东。

只不过吧,这次,这家厂商亮相的方式确实有亿点不一样。

此前,京东就官宣要打造全球最大的物理世界运营中心,没想到这么快就把最新成果搬到了WAIC现场——

首次集体亮相的JoyAI全系列大模型、具身数据采集与训练链路,还有以JoyInside为底座打造的京东AI Home,全都来了:

逛完今年的WAIC,我们会发现AI的能力边界,真的开始从数字内容的理解与生成,进一步延伸至物理世界的环境感知、实时决策与具体执行。

而过去停留在屏幕里的智能概念,如今已经开始进入工厂、家庭和各类终端设备,真正参与现实世界的现实运行了。

看得见、听得懂、还能执行,面向物理AI的模型全家桶来了

这两年,大模型已经进入密集发布期。

今年走进WAIC主场馆,我们会发现图像、视频、语音、交互、具身等不同方向的模型几乎覆盖了所有热门赛道。

但不得不承认的一点是,在真实的物理环境中,单一模型给出判断,只是整个AI任务执行流程的「起点」。

后续的路径规划、设备控制、动作执行与结果反馈,可以说每个环节都直接影响一个任务能否真正形成完整闭环!!

也正因如此,物理AI对模型能力的要求,也从单项能力的突破进一步延伸至感知、理解、决策、执行的系统协作。

就在今年WAIC现场,京东直接端上了一整套面向物理世界的JoyAI模型「全家桶」。

从语音、图像、视频、实时交互、到具身智能,可以说是把物理AI需要的模型能力统统梭哈了……

对物理AI来说,视觉能力决定了AI能否建立对现实环境的连续认知。

毕竟一台机器人真正开始行动前,需要先弄清周围有什么、物体位于哪里,以及彼此之间存在怎样的空间关系。

而京东此前开源的JoyAI-Image-Edit、JoyAI-Echo和JoyAI-VL-Interaction模型,刚好对应了视觉能力向物理世界延伸的不同维度——

JoyAI-Image-Edit实现了视角变换、空间漫游与几何一致性编辑,让AI从处理平面像素进一步走向理解空间结构。

△JoyAI-Image-Edit

JoyAI-Echo通过跨模态记忆维持长视频的一致性,JoyAI-VL-Interaction则把理解和响应压缩至毫秒级,让AI可以一边观察实时画面,一边交互、调用Agent。

值得一提的是,京东还在今年WAIC上,展示了多模态领域的最新研究成果:实时视频编辑模型JoyAI-Video-Edit。

具体来说,用户可以自定义画面,并在预览过程中实时修改,让视频生成具备更强的即时反馈与动态调整能力。

从长时一致性、实时理解到即时修改,几款模型分别补上了动态视觉中的不同环节,让物理AI既能记住前后变化,也能跟上实时画面,并根据环境变化及时调整反应。

△JoyAI-Video-Edit

视觉模型让设备看懂周围环境,但当设备真正进入家庭和零售场景,还要面对一个更难处理的变量——人的指令。

毕竟,大家都懂,现实交流很少按照标准格式发生。

语气、习惯和表达方式同样因人而异,对于物理AI来说能否真正听懂指令,直接决定了后续动作会不会跑偏。

在今年WAIC上,京东不仅亮相了语音生成基础模型JoyAI-Voice,还同步发布了新的语音交互模型:JoyAI-Talker~

其能够识别用户的情绪与真实意图,根据不同人的表达习惯调整回应,同时具备低延迟交互和随时打断能力。

这意味着,人与物理AI的交互能够从一次性下达指令,变成持续沟通:设备可以在执行过程中接收反馈、暂停动作、理解新的需求,再及时调整接下来的行动了!!

能看懂环境、理解人的意图,物理AI还要跨过最后一道门槛——让真实设备把模型的判断变成动作。

而京东的JoyAI-RA移动操控基础模型,解决的正是这段从决策到行动的转换。

通过统一训练框架,让不同机器人与人类操作经验能够在同一套动作表达中完成对齐,再结合仿真训练和真实环境验证,持续修正模型在现实中的执行偏差。

由此,物理AI在模型能力上,才真正完成了从感知、理解、决策到行动的完整闭环。

小机器人们,开始在物理世界狠刷「经验值」

机器人在模型里学会了看、听、理解和规划,真到了现实世界,还是可能被一只摆歪的杯子「难住」。

毕竟,模型给出的更多是智能上限。

这些能力能否迁移到物理世界的真实任务中,很大程度上还是取决于小机器人们在物理世界中攒到的经验。

读万卷书不如行万里路,这个道理放在小机器人身上,同样成立。

于是,随着机器人走向现实环境真实作业,一个越来越关键的环节被推到了台前,那就是「具身数据采集」。

与大模型的语料训练相比,机器人学习所需的真实经验,其实要比文本数据难攒得多,而且哪怕数据规模上去了,机器人也可能被「教坏」。

京东就做过一组很直接也很直观的实验——

他们分别用1万小时高质量数据和1万小时存在瑕疵的数据训练模型,结果发现,有瑕疵的数据即使继续往上堆,模型效果也未必提高,甚至还会越练越差。

所以在京东看来,数据时长只能反映采集规模。真正决定训练价值的,是动作、轨迹、任务结果和场景变化能否被准确记录和理解,背后还牵涉标注模型、算法精度与数据处理等一整套技术链路。

Scroll for more