刚刚,GPT-6 Astra接上宇树G1

量子位 · 经八阕原文

机器人的GPT时刻,还真得靠GPT(doge)!

刚刚,GPT-6 Astra接上宇树G1,进厨房干活了~

在斯坦福团队的最新项目HomeBody中,宇树G1先探索一个从来没见过的厨房,随后就能根据语言指令,收拾物品、丢掉纸盒,甚至把不在眼前的药找出来,递到人手里。

比如,让它把咖啡袋集中放到中间,再丢掉指定的牛奶和橙汁纸盒。

G1就会在厨房里来回搬运,把咖啡袋归拢到岛台上,再处理要丢弃的纸盒。

再比如,一句「帮我把药拿来」。

即使药不在当前视野里,它也能从之前保存的画面中找到线索,走到对应抽屉前,打开抽屉、取出药,再递给人,期间还能把丢纸盒的任务一并完成。

可以说,从Robocurve此前让GPT和Claude控制机械臂,完成桌面抓放测试,到这次G1走进厨房,大模型控制机器人的任务范围,又往外扩了一圈。

这一次,机器人不只要判断眼前抓什么,还得记住东西在哪,再把走路、抓取、放置连成一串。

更值得注意的是,团队表示,部署到这个新厨房时,系统不需要额外采集训练数据,也无须再训练一套专用动作策略,泛化性是相当可以了。

看到这里,有人已经忍不住开始盘算了:

我要是有钱买台G1,再接上GPT,是不是也能……?

不过,也先别急着下单,事情还没简单到「买台机器人,登录GPT」这一步。

咱们先看看HomeBody究竟是怎么把活干起来的?

让GPT把机器人技能当工具调用

简单来说,HomeBody的核心思路可以概括为一句话:让GPT把机器人技能当工具调用。

Astra负责理解目标、安排步骤,再调用导航、抓取、开抽屉等技能,把任务一步步做完。

不过,要让机器人去厨房拿东西,先得让它知道:厨房长什么样,东西又放在哪里。

整个过程,可以分成三步。

Step 1,先逛一圈,把厨房记下来

在HomeBody中,机器人接到的第一条指令很简单,「你是一台厨房机器人,请探索这个空间」。

随后,Astra会选择值得观察的位置,引导G1移动。机器人一边走,一边记录相机画面、激光雷达扫描,以及自身的关节姿态和途经位置。

相机负责看清房间里有什么,激光雷达等传感器提供实测的空间结构;SLAM,也就是同步定位与建图,则帮助机器人一边建立地图,一边确定自己在哪。

这些观察不会随着机器人转身就消失,而是会被保存下来,成为后续任务可以调用的空间记忆。

Step 2,把现实厨房搬进模拟器

逛完还不够,Astra接下来还要担任Real2Sim智能体,在Isaac Sim仿真平台里搭出一个数字厨房。

这个数字孪生相当于一份立体房间模型,帮助系统判断各处的位置,以及机器人与目标之间的空间关系。

为了让数字厨房不仅看起来像,HomeBody还会把SLAM测得的几何信息也交给模型,用真实测量约束重建结果。

毕竟,台面的位置、通道的宽度,都会影响机器人能不能走过去、手能不能伸到位。

随后,系统会把真实世界的定位地图与数字厨房对齐到同一个坐标系,再将拍到的画面、内容描述和对应位置关联起来。

这样一来,之前保存的画面就不只是「我见过这个抽屉」,还对应着一个可以返回的位置。

之后再找东西,机器人就能先从记忆里查线索,再走回对应地点。

Step 3,给个目标,让它自己安排动作

准备完成后,用户就可以说「收拾一下厨房」,再补充咖啡袋放哪里、哪些纸盒要扔。

Astra会结合当前画面、地图、空间记忆、手里有没有拿着东西,以及上一步的执行结果,选择接下来调用哪项技能、操作哪个目标。

前面展示的取药demo就用到了这种能力。用户虽然没说药在哪,但系统可以从保存的关键画面中找到抽屉,再把导航、开抽屉、取药等技能接起来。

GPT负责安排,身体到底谁来控制?

此前,Robocurve让GPT、Claude控制机械臂,是让模型根据相机画面和机器人状态,通过工具调用指定夹爪的位置、朝向和开合状态,再由底层模块转换成具体动作。

HomeBody同样采用工具调用,但交给GPT的是更完整的技能:导航、抓取、放置、开抽屉,以及从抽屉中取物。

要理解这两者的区别,咱们先看看机器人系统的一种常见分工:

System 2是视觉语言模型(VLM),负责看图、理解指令、决定做什么;

System 1是视觉语言动作模型(VLA),负责生成动作命令;

System 0则是底层控制器,负责协调身体执行。

简单说,就是「安排任务—生成动作—控制身体」。

而HomeBody调整的,正是中间这一环:让System 2直接调用技能库,由技能模块规划具体动作,再交给底层控制系统执行,不必经过一个学习型VLA。

具体来说,这些技能库里装的是已经写好、可复用的电机技能(Navigate、Pick、Place、Open drawer、Pick from drawer 等)。

这些技能有统一的接口:大模型只需要告诉它“去哪里、抓什么、放到哪”,技能自己执行,执行完再把结果反馈给大模型。

比如抓取,Astra只需要在画面中点出目标物体,再指定使用左手还是右手。

接下来,抓取技能内部的感知模块会圈出物体、估计深度,结合相机标定确定目标的三维位置,并计算抓取姿态。运动规划器再规划机械臂怎么伸过去、怎样避开障碍,最后交给控制模块执行。

换句话说,GPT决定抓哪个、用哪只手,技能模块解决手怎么伸过去、怎么抓起来。

其他技能也遵循类似的分工。导航接收目标位置和朝向;放置接收物品的落点;开抽屉则把对准把手、勾住把手、后退拉开,封装成一项完整技能。

每项技能执行后,都会把结果反馈给Astra,再由它决定下一步。遇到偏差时,技能模块会先自行调整、重试,解决不了再交回大模型重新安排。

来源:量子位(经八阕转载) · 查看原文
Scroll for more