产品派
返回

商汤大装置日均Token服务量增至4.5万亿

AI量子位2026/9/23 17:56:53
AI 导读

随着Token调用量快速增长,推理已取代训练成为算力需求的主要增长动力。商汤大装置资深技术专家罗伟在2026全球AI芯片峰会相关研讨会上,介绍了面向规模化推理的异构架构、模型适配和技术演进方案,重点讨论如何提升Token生产效率、服务稳定性与单位成本表现。

Agent应用带来的推理负载不同于传统单轮对话:长上下文会持续增加输入计算量和KV Cache占用,多轮交互要求系统处理前缀复用与变化中的热点,突发流量和长尾请求则使请求规模、输入输出长度不断波动。针对这些特征,系统设计转向围绕Token、状态和时延预算组织资源。截至8月,商汤大装置日均Token服务量已从2月的0.46万亿提升至4.5万亿。

为将单点性能转化为整体产能,商汤大装置采用横向资源编排与纵向性能优化两条路径,目标包括满足模型质量和SLO要求、提高有效吞吐并降低单位产能成本。横向方面,平台为不同品牌和规格的算力建立统一资源画像,记录计算吞吐、KV Cache容量、有效带宽及模型兼容性,并对请求从准入配对、Prefill执行、KV Cache交接到Decode接管实施全生命周期管理。

平台不会将某类芯片永久限定为Prefill节点或Decode节点,而是依据模型、批量规模和上下文长度等瓶颈动态调整角色。纵向方面,则围绕模型、引擎和芯片进行协同优化:模型侧调节权重量化与显存预算,引擎侧优化Attention、GEMM等核心算子的并行执行,芯片侧适配编译、访存调度和内存管理,并通过真实负载验证优化效果,避免只提升单点指标。

在调度架构上,系统正从固定的P/D资源配比转向动态资源池。Prefill Pool和Decode Pool会结合实时负载、KV Cache状态及节点健康度进行请求路由和资源匹配。长输入导致Prefill压力上升时,可增加P节点;长输出造成Decode负载升高时,则增加D节点,必要时还可切换节点角色,使资源随负载变化,在保障SLA的同时提高利用率。

面向多模态和MoE模型,下一步架构将继续从P/D两阶段拆分为模块级资源池,把Encoder、Attention、FFN以及视觉编码等模块分别部署到独立资源池中,并根据各自负载进行弹性扩缩容,以实现更精细的资源匹配和更高利用率。

商汤大装置表示,后续将继续推进产品与技术迭代,并与生态伙伴协作完善面向大模型的AI基础设施,提升Token服务能力,推动AI应用更广泛地落地。

异构算力大模型推理Token服务资源调度

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文