谷歌机器人整了波大活儿雷科技
前段时间,雷科技 WAIC2026 报道团亲赴现场,近距离观察了这场全球 AI 大展,也看到了一场规模空前的人形机器人成人礼。超过 200 家机器人相关企业、300 多台真机同台竞技——从宇树三米高的载人变形机甲来回切换形态,到智元的机器人用镊子夹起 2 毫米电阻焊到电路板上。过去最容易围住观众的后空翻和机械舞还在,但厂商越来越想证明另一件事:机器人不只会动,还能干活,甚至干更多活。
但造出一副能跑、能跳、能伸手的「身体」,已经不是当下最稀缺的能力。真正的瓶颈是「大脑」,是怎么让机器人看懂混乱的环境,决定下一步做什么,再把决定稳定地送到几十个关节。
就在 WAIC 结束一周多后,Google DeepMind 推出了 Gemini Robotics 2,一个主打「全身智能」的机器人通用模型,适用于各种不同形态的机器人。
但最重要的关键词还是「全身智能」。人类弯腰捡起地上的水壶,会自然地前倾、屈膝、伸手,同时调整重心。封一只自封袋,会自然地对齐两侧封口,再用手指从一端捏到另一端,还会根据塑料的形变随时调整力度。机器人却要连续算对一串彼此牵制的动作。
图片来源:Google Deepmind
身体零件越齐全,控制难度反而越像滚雪球。
而谷歌这次的发布包含三个模型。Gemini Robotics ER 2 负责理解环境、规划长任务和与人沟通,Gemini Robotics 2 这个 VLA 模型把视觉与语言直接转成动作,On-Device 2 则把动作模型压到本地,并能用少于 200 个样例、几小时数据适配新的机器人本体。
但核心在于,谷歌开始用一组模型协调一台人形机器人的双腿、躯干、双臂和手指,让它一边思考推理,一边移动操作。
机器人终于不用“先站好、再伸手”了过去不少机器人演示,都有一种很强的回合制游戏感。机器人先走到桌边、停下、站稳,然后调用机械臂抓取物体。抓完以后,它再次切换到行走控制器,去往下一个位置。每一段动作都可以做得很好看,但只要桌子偏了一点、物体滑了一下,或者它必须边走边维持抓握,几个独立模块的接缝就会露出来。
上一代 Gemini Robotics 也主要控制机器人的上半身,处理桌面任务。到了 Gemini Robotics 2,官方视频中的 Apptronik Apollo 2 会走向放在地上的绿色水壶,弯腰把它提起来。另一段画面中,Apollo 2 走到货架前,取出一只棒球手套,随后转身离开。
图片来源:Google Deepmind
这些动作看起来平平无奇,背后却同时依赖视野、可达范围、步态和重心。手臂伸得更远,身体就要跟着前倾。身体前倾,双腿又必须及时补偿。
视频也特别标注,画面中的机器人均为自主运行,动作按真实速度播放。
这也是「全身」的实际含义:模型不再把腿当运输工具、把手当作业工具,而是把整副身体视为一个相互耦合的动作空间。谷歌称,同一个模型已经用于搭载不同灵巧手的 Apollo 2,以及使用两指夹爪的 Franka Duo。至少在技术方向上,它想做的不只是一颗适配某款人形机器人的专用大脑。
当然,演示也没有快到让人产生错觉。Apollo 走路、下蹲和摆放物体的速度都很慢,谷歌自己也承认移动速度仍需提高。官方测试中,Apollo 从桌面、地面和货架取物的平均成功率分别为 68.4%、45.7% 和 76.3%。最能体现全身控制的地面取物,恰好也是成功率最低的一项。
方向是对的,只是动作还不够利索。
从拧灯泡到扎垃圾,机器人难在「最后几厘米」全身控制解决的是机器人怎么抵达、怎么站稳。真正决定它能不能进入家庭和工厂的,往往还是最后几厘米。
在官方视频里,Apollo 2 使用一只拥有 22 个自由度的五指 SharpaWave 灵巧手,尝试拧灯泡、封自封袋、给垃圾袋打结。另一边,Franka Duo 的两只夹爪负责把形状各异的工具紧密装进工具箱。
图片来源:Google Deepmind
过去机器人最常见的抓取演示,往往只是把一个硬物从 A 点搬到 B 点。这些任务却涉及连续接触、双手配合和形变:塑料袋会塌,绳结会滑,灯泡既要对准螺纹,又不能捏得太用力。
人类做这些事时,不会先想好 22 个关节各自旋转多少度。Gemini Robotics 2 要做的,正是从视觉和指令直接生成这些高频、连续的动作。
不过谷歌公布的成绩也很实诚。两指夹爪在通用抓放、工具配套和精密插入上的平均成功率达到 74.2%、78.9% 和 89.6%,到了多指灵巧手,差距迅速拉开:拧下灯泡达到 92%,拧上灯泡只有 36%,扎垃圾袋是 44%,使用簸箕和封自封袋分别只有 32% 和 40%。
这组数字也说明了大模型已经能接管相当复杂的手部动作,而多指灵巧操作远没有达到官方模型页面所说的「人类级」。至少现在,机器人拧灯泡仍然可能十次失败六次。
图片来源:Google Deepmind
第三个变化是协作。视频中,Apollo 与 Franka Duo 共同整理工具箱。Apollo 发出任务,Duo 把工具装入盒内,两台机器人各自运行一套模型,通过高层推理分配和衔接工作,而不是由一个中央神经网络同时操纵两副身体。ER 2 还会持续查看视频,判断任务进度、发现失败并决定是否重试。
这和两台机器人机械地执行预设工序不太一样。谷歌想让不同形态的机器人先理解彼此擅长什么,再像团队一样交接任务。只是官方视频展示的是一个经过设计、总长几分钟的工具收纳场景,离多台机器人在真实工厂里连续协作几个月,还隔着很长的稳定性验证。
谷歌没有抛弃「大小脑」,只是拆掉身体的边界具身智能行业目前普遍将机器人架构概括成「大脑」和「小脑」。大模型负责看懂指令、拆解任务,小模型和传统控制器负责导航、平衡、抓取。这样做很务实:高层推理不需要每秒运行数百次,底层控制也不能等一个大模型慢慢思考。模块分开,部署、调试和安全兜底都更容易。
问题在于,物理世界并不喜欢整齐的模块边界。
抬起一个重物会改变平衡,向前迈步会改变手臂的可达范围,手里的杯子一滑,原来的路径规划马上作废。高层计划与底层动作只要理解不一致,错误就会在长任务中累积。每次从行走切换到抓取、从抓取切回导航,也可能带来停顿。机器人明明计划对了,身体却没有照做。
但严格来说,谷歌并没有放弃「大小脑」。ER 2 依然是高层大脑,负责看、想、规划和调用工具,再把动作执行交给 VLA。它甚至可以把导航 API、机械臂接口和其他厂商的 VLA 当成工具。
谷歌解决的,是在动作层继续把走路、平衡、躯干和手臂切成一堆互不相干的小脑。Gemini Robotics 2 用一个 VLA 统一全身动作,ER 2 则可以一边观察执行,一边思考后续步骤,减少机器人每做一步都要「停下来想想」的割裂感。
图片来源:Google Deepmind
这是一条更准确的分界线:高层仍然分层,身体开始端到端。
这也解释了谷歌为什么没有把所有环节都塞进一个巨型网络。机器人底层控制追求毫秒级响应,高层推理却可能要检索资料、理解人类含糊的要求。两者需要的算力、数据和运行频率都不同。全部揉在一起,训练成本会迅速上升,出了问题也很难判断究竟是计划错了,还是关节没有执行到位。
更现实的是安全。模型可以决定把水壶放到货架,急停、限速和人与机器人的安全距离却不能只靠概率保证。ER 2 引入安全约束、可行性判断和请求人类介入,底层仍保留传统物理安全机制,说明谷歌也没有打算让端到端学习包办一切。
而且这条路线也不是谷歌独有。Figure 在今年初发布的 Helix 02,同样把所有传感器接入一个全身视觉运动策略,让 System 1 以 200Hz 输出全身关节目标,再由 System 0 以 1kHz 处理平衡和接触,最上层的 System 2 继续负责语义推理。看起来像一个模型,内部仍是按不同时间尺度紧密咬合的三层系统。


