IROS 2026论文显示机器人研究走向系统融合
IROS 2026将于9月27日在匹兹堡开幕,这也是该会议时隔31年再次回到这座城市。作为全球重要的机器人学术会议之一,本届进入正式议程的论文共有1933篇,覆盖强化学习、模仿学习、路径规划、视觉感知、运动控制、灵巧操作、人形机器人、触觉以及大模型等多个方向。
对这些论文进行多标签统计后可以看到,Robot Learning / Embodied AI相关论文约809篇,Navigation / Planning约564篇,Perception / Vision约556篇,Control / Dynamics约546篇,Manipulation约520篇,Humanoid / Legged约213篇。由于单篇论文可能同时属于多个方向,这些数字不能相加,但它们显示机器人研究并未被大模型统一成单一AI问题,而是呈现学习、感知、规划、控制和操作高度交织的趋势。
进一步看交叉方向,Robot Learning与Manipulation共同出现的论文约276篇,与Perception交叉约269篇,与Navigation / Planning交叉约225篇,与Control / Dynamics交叉约221篇。这说明AI方法并未挤压传统机器人模块,而是在更深地嵌入其中。例如石溪大学Jorge Mendez-Mendez关于LLM与Task and Motion Planning的研究表明,大语言模型能理解任务语义,但几何约束、运动可行性、碰撞检测和执行逻辑仍依赖传统规划体系。
在感知与控制端也有类似变化。天津大学、原力灵机和清华大学团队的GeoVLA将深度和三维几何信息纳入视觉语言动作模型,以弥补传统VLA过度依赖二维图像的问题;中佛罗里达大学等团队的研究则让大型基础模型主要参与训练,再由轻量策略负责高频执行,以解决大模型推理过慢、不适合机器人实时控制的矛盾。科罗拉多大学丹佛分校等团队的DexTact还将视觉、触觉、灵巧抓取和控制放入同一系统中讨论。
VLA相关研究也从“证明可行”转向“补短板”。统计显示,VLA、VLM、LLM和Foundation Model相关论文约162篇,占全部论文8.4%,其中明确涉及VLA的约82篇。这些工作不再只追求模型规模,而是集中处理效率、三维理解、长时记忆、视角变化、现实部署和安全问题。42dot、首尔大学和Samsung Research的Shallow-π通过知识蒸馏压缩流式VLA,目标是让模型更适合真实机器人和边缘设备。
首尔大学与MIT团队的AnyCamVLA关注相机视角变化后的零样本适配,因为真实部署中相机安装误差和平台差异很常见;南京大学、早稻田大学、逐际动力、浙江大学等团队的Long-Term Memory for VLA-Based Agents则让VLA Agent保存并调用过往轨迹和经验,面向开放环境中的长流程任务。成均馆大学的RoboBRIDGE采用模块化框架,在预训练策略外加入Monitor、Perceptor、Planner、Controller和Robot Interface,使系统能在失败或环境变化时进行监测、更新和重规划。
另一条明显趋势是机器人系统正在重新引入“中间层”。在1933篇论文中,Reasoning / Memory相关论文约119篇,占6.2%,其中Reasoning约64篇、Memory约36篇,并形成了围绕VLA操作、长程操作约束推理、机器人任务中的LLM Agent推理以及三维空间表征的多个专题。这意味着经历端到端模型热潮后,研究者开始重新重视推理、记忆、规划、几何和控制等结构化环节,机器人学正进入更复杂的系统融合阶段。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文