产品派
返回

任少卿时隔十年再任通讯作者发布自动驾驶论文

AI量子位2026/9/24 20:58:55
AI 导读

任少卿指导的论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》近日发布,第一机构为蔚来。论文提出多模式世界—动作联合模型,让自动驾驶同时生成多组轨迹及其对应的未来场景。任少卿此前代表性工作集中于2014年至2016年的Faster R-CNN、ResNet等视觉研究,此次时隔约十年再次担任相关论文通讯作者。

传统World–Action Model主要分为级联式和联合式:前者能产生多个结果,但场景与动作只能单向传递;后者支持双向影响,却通常只生成一组结果。MM-Future为每种候选建立配对的场景—动作假设,使车辆动作和环境变化持续相互修正,再从多个可能未来中选择方案。

为获得多样结果,模型在动作端使用基于训练轨迹分布的Gaussian Mixture Noise,场景端使用独立噪声,并通过Best-of-Many监督,让动作流和场景流共享同一个最优候选索引。该设计避免所有候选被同一条真实轨迹拉拢,同时保持每条轨迹与其未来场景的配对关系。

模型还引入MM-Tokens,将多摄像头、多时间帧的视觉信息压缩成面向规划的紧凑表示,不负责RGB重建或完整BEV恢复,重点保留道路、路口、前车和交通参与者等信息。modality-aware Transformer负责动作流与场景流交互,不同模式之间不交换Token;Future-Conditioned Proposal Scorer则只读取每条轨迹配对的未来进行评分。

完整推理流程包括编码历史观测、生成多组场景—动作结果、结合历史与配对未来评分,以及输出最高分轨迹。论文在NAVSIM-v1 navtest取得94.0 PDMS,高于DriveFuture的90.7和DrivoR的93.7;NAVSIM-v2取得91.5 EPDMS,高于UniTeD的90.1和DriveFuture的89.9。

消融实验显示,仅生成动作且只有单一模式时PDMS为84.1,增加至32种候选后升至92.3;加入场景—动作联合生成后,单模式为85.1、32模式为92.9;再让评分器读取配对未来,指标升至93.3。评分器对TTC改善最明显,说明未来场景有助于排除交互风险。16模式和32模式达到0.80验证PDM约需3.8k steps,单模式则需17.5k steps。

代价是计算量增加:主模型一次采样64组候选,在单张NVIDIA H800、batch size 1、bf16条件下端到端延迟约233ms,16组接近单模式,32组后明显上升。未针对HUGSIM继续微调时,模型在436个场景取得32.3平均HD-Score,高于Latent-WAM的28.9和UniAD的28.6,但Route Completion为44.5,低于45.9;Extreme难度HD-Score为8.6,低于18.1。

团队主要来自蔚来智能驾驶基础模型预研团队。第一作者Shuai Liu同时来自蔚来和中山大学,曾以第一作者发表并获NeurIPS 2025接收的GaussianFusion;Hechangle Gong同时署名蔚来和北航,其余作者包括Hao Jiang、Runlin He、Junxiang Zhan、Sheng Yang及中山大学的Kai Huang。论文通讯作者任少卿现为中科大讲席教授、通用人工智能研究所所长及蔚来智能驾驶业务负责人。

论文认为,MM-Tokens的隐式表征仍不易解释,极端场景稳定性和真实道路表现也有待验证。蔚来于2024年发布NIO WorldModel和NADArch 2.0,2025年加入全闭环强化学习,2026年初推送新版NWM;截至今年9月,相关系统已部署到超过95万辆车。MM-Future展示了世界模型从预测未来走向参与规划,再到联合比较多种动作及其后果的演进路径。

自动驾驶世界模型端到端驾驶蔚来规划模型

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文