斯坦福团队用分层架构控制宇树G1完成连续任务
斯坦福大学 The Movement Lab 与加州理工学院公开了 HomeBody 项目。研究团队将 GPT Astra 接入宇树 G1,让机器人先探索陌生厨房,记录物体与空间位置,再按指令完成找东西、拿药、扔垃圾、开抽屉等连续任务。机器人并不知道目标的初始位置,必须利用探索阶段形成的记忆进行后续决策。
GPT Astra 不直接输出关节动作,导航、轨迹规划、碰撞检测、视觉伺服和全身控制均在本地运行。大模型只负责理解任务、选择技能和处理失败后的重新决策。这种分层方案避开了端到端 VLA 直接生成动作的路线,重新讨论语言到动作之间的策略层应保留多少。
系统把机器人能力封装为结构化工具调用。Pick 接收图像中归一化到 0–1000 的二维点及左右手参数,Navigate 接收地图坐标和朝向,Place 使用躯干坐标系的三维释放位置、执行手和距离;开抽屉则将视觉对准、挂住把手和后退行走整合为单一技能。Astra 不必了解 G1 的自由度或逆运动学,底层实现可以替换为解析方法、传统规划器或强化学习策略。
仅靠当前画面无法找回几分钟前看到的药瓶,因此系统将视觉历史与真实尺度坐标连接起来。G1 探索时同步保存相机、D435i 双目、LiDAR、SLAM、关节状态和航点,并通过 Real2Sim 重建 Isaac Sim 环境;Super Odometry 获取现实地图状态,ICP 将 SLAM 点云与数字环境配准。这样,语义记忆与度量几何被分开保存,导航可回到目标历史位置。相比只用视频估计房间尺寸,SLAM 点云能提供实测尺度约束。
到达目标附近后,Pick 先用二维点提示分割,再由 Fast-FoundationStereo 根据 D435i 恢复深度,并结合标定关系生成三维抓取姿态。规划器使用 spline reference 和 minimum-jerk timing 平滑轨迹,逐点求逆运动学,同时检查整段 swept motion 的碰撞,而非只检查终点。
机器人移动会造成视角变化,系统继续用 SAM 2.1 跟踪目标、借助 SAMURAI 的 memory selection 保持跨帧状态,并通过视觉伺服在线修正。抓取失败时,技能可更换候选姿态或调整站位;只有局部恢复无效,才把失败原因交给 Astra。手臂控制运行在 250 Hz,AMO 每 5 个控制周期更新一次、约为 50 Hz,远端 GPT 推理则处于秒级,停顿主要出现在技能切换处。
开抽屉时,机械手挂住把手后,G1 需要边维持上肢目标边向后行走。AMO 将 Sim2Real 强化学习与轨迹优化结合,通过躯干和下肢扩大操作空间。由此形成完整链路:Astra 负责任务目标,空间系统负责定位,感知模块恢复三维几何,规划器生成轨迹,视觉伺服修正误差,全身控制维持稳定。
项目仍有明显限制:Real2Sim 增加部署和接口成本,远端推理会造成技能间停顿,本地感知与规划需要 RTX 4090 笔记本,长任务还受工作空间、舵机发热和硬件耐久度影响。技能库也决定能力边界,没有擦桌子或柔性物体控制器,语言模型无法凭空生成相应动力学。HomeBody 展示的重点因此不是万能模型,而是以标准接口连接高层决策、空间状态、视觉处理、运动规划和高频控制。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文