产品派
返回

MLPerf新增KVCache测试推动AI存储走向跨节点复用

AIInfoQ 中文站2026/9/16 07:00:52
AI 导读

在日前公布的 MLPerf Storage v3.0 结果中,焱融科技 F9000X 三节点集群在 3D U-Net 训练数据供给测试中实现 544GiB/s 聚合带宽,并在 Checkpoint 70B 项目中同时获得读、写带宽第一。更值得关注的是,本届评测新增 KVCache 测试,模拟多轮会话中的缓存写入与回读,并统计输出 Token 吞吐、读写带宽及 P95 读取时延,显示 AI 存储正从服务训练数据延伸到承载推理运行状态。

训练存储主要解决 GPU 等待数据和 Checkpoint 恢复过慢的问题;推理则要避免长上下文反复执行 Prefill。Transformer 生成过程中保留的 Key、Value 状态可以复用,但跨请求复用必须满足严格的提示词、Token 序列、模型版本和精度格式一致性。显存还要容纳权重与并发任务,缓存可能被换出;若缓存留在 A 节点而请求被调度到 B 节点,没有共享和缓存感知调度,系统仍只能重新计算。

YRCache 在单机内构建 G1 GPU 显存、G2 主机内存、G3 本地 SSD 三级缓存,利用配额、资源隔离和多盘 NVMe 聚合管理换入换出。但本地 SSD无法解决全局发现、跨节点访问及节点故障问题,传统分布式存储又侧重模型、数据集和 Checkpoint 的持久化,难以经济地满足 KV Cache 高频、低延迟、短生命周期的需求。

ContextBox 因此被定位为 G3.5 独立共享缓存层,连接计算节点与持久化存储。它最多搭载 26 块 U.2 NVMe SSD,配备 4 块 NVIDIA BlueField-3 双口 200Gb DPU,借助 RDMA/RoCE 实测提供 120GB/s 带宽,单台可支撑 8 节点并发。YRCache负责缓存匹配、生命周期和跨层调度,并兼容 LMCache、Mooncake;G4则继续承载长期数据。

这样,A 节点生成并下沉到 G3.5 的长文档缓存,即使该节点繁忙,B 节点也能直接读取,仅计算新增问题,避免排队或从头预填充。

缓存并非越多越好,写入、索引、传输和装载成本必须低于重算收益。企业测试显示,在 8 卡 NVIDIA H20-3e(单卡 141GB HBM)、SGLang 和 GLM-5.1 环境中,31K 至 129K 长输入接入两套系统后,首 Token 时延降低 89% 至 94%,Token 吞吐提升 3 至 6 倍。

这类结果主要适用于高命中率的长上下文业务。焱融还测算,在 64K 输入、50% 命中率、GPU 持续满载的理想条件下,单台 8 卡服务器月度“等效产值”可由 5.2 万元增至 11.9 万元,但这不是营收或利润,仍需计入硬件、网络、电力和运维成本。未来 AI 存储的衡量标准,将从带宽和 IOPS 扩展到计算状态能否被正确寻址、调度并在集群中高效复用。

KV CacheAI存储推理系统分布式缓存

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文