产品派
返回

openJiuwen发布昇腾亲和路由,Token消耗降超50%

AI量子位2026/10/2 15:34:15
AI 导读

openJiuwen推出面向Agent的自演进模型路由技术,核心目标是避免所有请求都调用高成本大模型。系统会结合任务复杂度、模型能力、实时负载、缓存状态和业务偏好,动态选择单一模型或多模型协作,实测可将Token消耗降低50%以上,并支持昇腾算力环境。该项目由华为2012实验室、华为云、终端、计算、算力先遣队等团队联合高校和企业开发者构建。

这套路由体系包含三层能力:模型画像、实时决策和反馈演进。模型画像基于历史数据离线建立,并在线记录不同任务类型与难度下的效果、时延、功耗和成本;模型版本或表现变化后,画像更新时延优于1分钟。路由层只负责判断,具体调用交由宿主执行,从而实现决策与执行解耦。

△模型能力画像会持续记录并刷新每个模型的能力档案

在决策环节,系统不会只看当前一句话,而会分析近期对话、工具调用进度和完整任务轨迹,并保留最近一次用户诉求,避免工具输出挤占上下文。它还会综合KV缓存亲和度、模型实时负载、响应时延、限流或超时状态,以及质量、成本、速度、上下文和工具兼容性等约束,通过启发式优化选择综合最优模型,而非盲目选择最强模型。

△路由按请求分析、算法判定、输出选择和宿主调用完成动态选模

第三层将运行算法与跨请求状态分离:算法在相同请求和状态下应得到相同结果,历史结果、缓存亲和、排除项和经验数据则存放在独立状态层。每次调用结束后,宿主回传成败、耗时、成本和质量等反馈,系统据此更新经验并影响下一次选择。即使状态丢失,也只会退化为“冷路由”而不影响请求;运行时可通过Contextual Bandit和轻量强化学习学习,画像、算法和策略也可独立升级。样本不足或优势不明显时,系统会保留原判断。

△执行反馈会沉淀为经验,持续修正后续模型选择

除单模型路由外,系统还可接入WorkSwarm的MoA多模型协同能力:路由决定是否启动多个模型及具体成员,MoA负责语义去重、质量筛选、冲突消解和结果压缩聚合。进一步地,模型、Skill、Tool和SubAgent也能纳入统一调度,由路由编排推理、工具执行和子Agent查证,并结合反馈Hook与Fallback机制持续优化策略。

△多模型协同的重点在于对结果进行有效聚合,而非简单增加模型数量

这项技术需要在成本、时延、质量以及上下文和工具兼容性之间实时权衡。openJiuwen没有设定适用于所有业务的固定最优解,而是提供可配置、可演进、可观测的路由系统,让业务自行设定偏好,并依据真实执行反馈持续调整。这样一来,模型更新或价格变化时无需重做整套工程,路由可继续演进为长期基础设施。

智能体模型路由昇腾大模型优化

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文