产品派
返回

无问芯穹联合清华上交开源APXInf引擎,延迟降至26毫秒

AI量子位2026/9/15 18:43:28
AI 导读

具身模型需要在机器人本体上持续完成感知、决策和控制闭环,端侧推理不仅要应对有限算力、功耗和成本,还要兼顾小Batch、低延迟与长期稳定运行。云端框架直接迁移到机器人后,可能面临加载慢、资源利用率低、响应滞后和运行不稳定等问题。

无问芯穹联合清华大学、上海交通大学开源了具身智能端侧推理引擎APXInf,覆盖模型开发、效果验证和本体部署环节,支持RTX 4090、Jetson Orin及Jetson Thor等平台。其目标是在有限资源下让模型运行得更快、更稳,并降低接入和持续迭代的门槛。

在性能方面,APXInf围绕Pipeline、Graph、Kernel和量化进行端到端优化,并结合定制化运行时及Agent4Kernel融合算子。在Jetson Thor上,PI 0.5 FP8的端到端推理延迟由278毫秒降至26毫秒以内,推理频率达到38.46Hz,延迟下降约10.7倍,可满足机器人实时感知与控制需求。

稳定性方面,APXInf采用Rust构建轻量运行时,并通过Python接口提供易用调用方式。该设计利用内存安全特性降低内存风险,同时通过冗余特性和功能隔离减少运行开销,面向长时间运行、并发任务及有限资源环境提升可预测性。

APXInf还面向Agentic Engineering和Agentic Native演进,通过冗余特性、工具箱模型等设计提升新模型适配效率,在保持深度优化能力的同时降低自研模型接入成本。首发支持PI 0.5和WALL-OSS,后续将适配Qwen、Groot等模型,并推进VLA、VLM、世界模型、nvfp4优化、国产芯片与机器人操作系统,以及AMD等硬件支持。

该项目将端侧部署接入RLinf生态。2025年9月,无问芯穹联合清华大学等团队开源面向具身智能大规模强化学习训练的RLinf框架,APXInf则补足训练、评测之后的本体推理环节,形成从模型训练到真实机器人运行的链路。项目现已开放GitHub仓库和Quick Start,并招募机器人、模型及端侧系统开发者提交Issue或贡献PR。

具身智能端侧推理机器人开源项目

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文