Skild AI让人形机器人靠自我对弈学会踢球
Skild AI展示了一台名为Messinator的人形机器人。它身穿阿根廷队服,能够带球突破、护球、抢断并完成射门。训练阶段只设置“进球”这一最终奖励,盘带、倒地起身等动作均未被单独设定分数。
Messinator的名称由Messi和Terminator组合而成,其核心控制系统来自Skild AI的机器人基础模型S1。S1支持上下文学习,机器人观看任务示范视频后,可理解其中意图,并将动作转换为适合自身身体的执行方式,无需为每项新任务重新训练。
为突破人类数据和经验的限制,团队在S1上加入强化学习与self-play。机器人被放入NVIDIA Isaac Sim搭建的虚拟足球场,只与此前保存的模型版本对抗;获胜策略会成为下一轮更强的对手。经过约140年的虚拟世界杯训练,它从最初连走路都不稳定,逐步自行掌握起身、绕过防守、用身体护球和主动抢断等技能。
训练中没有工程师规定具体动作,机器人保留这些行为的唯一原因是它们有助于赢球。Skild AI认为,这种方法延续了AlphaGo通过自我对弈发现新策略的思路,也让Messinator能够把虚拟足球经验迁移到真实人形机器人,并在真人对抗中动态调整位置和动作。
这项成果建立在Skild AI的通用机器人路线之上。公司于2025年7月发布可跨硬件运行的Skild Brain,目标是让不同形态的机器人共享一套大脑。随后,团队在仿真环境中生成约10万种身体结构,累计训练约1000个仿真年。
测试时,模型还要控制训练中未见过的机器人,即使出现断腿、关节锁死、车轮卡住或额外负重,也能在线调整重心和运动方式,部分情况下几秒内恢复平衡。Skild Brain负责通用控制与适应,self-play则负责探索更优行动策略。
Skild AI成立于2023年,源自卡内基梅隆大学机器人研究体系,成员来自CMU、斯坦福、伯克利以及Meta、Tesla、NVIDIA等机构。联合创始人兼CEO Deepak Pathak是CMU教授,曾任Meta AI研究员,研究覆盖好奇心驱动探索、自监督学习、视觉模仿、Sim2Real和自适应控制;总裁Abhinav Gupta同为CMU教授,长期研究视觉学习、终身学习、机器人操作和物理常识,曾参与创建Facebook AI Research匹兹堡实验室。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文