穆尧创办观行智能押注具身自我进化
穆尧在2021年进入香港大学MMLab攻读博士,师从罗平教授与汤晓鸥教授,彼时具身智能仍缺少成熟数据集、统一Benchmark和清晰技术路线。几年后,他主导的RoboTwin成为国内具身智能研究中常用的基准之一,GitHub星标超过2900,蚂蚁集团LingBot-VA、生数科技Motubrain等团队都曾在该基准上刷新成绩。穆尧本人也入选国家级青年人才计划,并担任上海交通大学长聘教轨助理教授,谷歌学术引用超过5000次。
2026年,穆尧创办SeeAct AI观行智能,将方向集中到“具身自我进化”。他认为,具身智能的长期终局会走向奖励驱动的自我进化。这一判断延续了他在清华读硕士时对端到端Policy和奖励驱动的坚持。当时自动驾驶行业普遍将感知、规划、控制分开处理,而他更倾向于让神经网络承载策略,并通过视觉反馈和环境奖励持续改进。后来特斯拉FSD推动行业进一步转向端到端路线,也印证了这类技术判断的价值。
穆尧最早在2017年系统学习强化学习,受到David Silver课程、Sutton《Reinforcement Learning》以及AlphaGo的影响。他认为,AlphaGo通过奖励驱动、自我规划和自我推演获得超越人类的能力,展示了人工智能的重要方向。在自动驾驶研究中,他曾尝试连接Model-based RL与Model-free RL:前者样本效率更高但存在模型误差,后者依赖真实数据但交互成本高,因此需要根据环境反馈持续修正模型与现实之间的偏差。
从自动驾驶转向具身智能,是因为他认为车辆虽然也是具身智能体,但动作空间和应用环境相对受限。进入具身智能后,研究对象扩展到夹爪、灵巧手、双足、四足、轮式机器人、双臂和工业臂等多种形态。2023年大模型兴起后,他参与了EmbodiedGPT、RoboCodex等工作,尝试用上层大模型拆解任务、生成底层代码并调用机器人执行接口,同时强调物理世界必须依赖视觉乃至三维信息反馈。
RoboTwin则从代码生成和仿真数据构建中发展而来。穆尧团队希望打造一套足够轻量的机器人引擎和仿真数据管线,让学生使用普通游戏本也能运行。RoboTwin 1.0覆盖场景生成、任务生成、数据生成和早期Policy Model评测;2.0将任务规模扩展到约50个,并升级行为生成与代码生成能力;3.0与摩尔线程合作,进一步支持国产显卡和国产物理引擎,同时也希望兼容更多硬件和引擎,形成更开放的生态。
在代码生成体系趋于完善后,穆尧开始关注VLA和具身基础模型。他认为,传统机器人系统底层API主要由工程师编写,可扩展性有限,因此需要探索由数据驱动、端到端神经网络承载的技能。由此,他的研究逐渐形成两条线:一类是端到端策略基础模型,另一类是以代码生成为核心的Agent System。当端到端模型达到可用水平后,它可以作为Skill嵌入上层智能体系统,由上层负责复杂任务推理与拆解,底层负责泛化执行,相关设想在与智元合作发布的RoboClaw中得到进一步实现。
穆尧将具身智能的规模化分为三层:数据规模化、模型规模化和经验规模化。他认为前两者已成为行业竞争焦点,而真正不足的是Experience Scaling。机器人不能只学习人类演示,还要在真实或仿真环境中持续尝试,理解自己执行时会遇到的失败、偏差和反馈。例如拧瓶盖时,抓取位置偏移、打滑、力度不合适等问题,都需要机器人通过交互形成经验,并在后续任务中复用。
在他看来,自我进化解决的是如何把经验转化为能力,奖励驱动则提供评价机制。系统需要根据任务结果和环境反馈判断哪些尝试更有效,再更新底层操作策略、上层规划决策、记忆和技能库。“递归自我进化”进一步强调,能力提升后机器人可以自主执行更难任务,产生质量更高的新经验,而这些新经验又推动下一轮能力提升。强化学习是其中的重要工具,但不是全部;完整的具身自我进化还需要策略基座与智能体系统协同更新。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文