产品派
返回

AI推理日均调用140万亿Token,存储分工加速重构

硬件雷锋网2026/10/10 09:38:00
AI 导读

第五届GMIF 2026全球存储器行业创新峰会显示,存储投资正从HBM扩展至更多介质。摩根士丹利预计,在不计HBM的情况下,存储约占全球云数据中心资本支出的近五成,2027年升至53%。截至今年3月,中国日均Token调用量超过140万亿,相当于国家图书馆藏书Token量的20倍以上,接近人类历史出版物总量的6倍。

规模化推理带来数据丰富度、推理复杂度和运营持久性三重压力。车载Agent需同时处理语音、视觉、车辆信号、对话历史、长期记忆、用户画像及实时车况;模型变大增加权重和运行时状态,长上下文与多用户会扩大KV Cache,Decode阶段还会反复读取这些数据。Agent持续运行后,任务上下文和状态进一步累积。

企业可能部署数百个全天候Agent,服务商还要保障MaaS接口的首Token时延、成功率、吞吐量并控制费用。本地Token工厂则更重视算力利用率、稳定性和单位Token成本。存储因此需要同时应对不同数据的访问频率、生命周期、容量、带宽、时延与耐久性,原有存储金字塔也被进一步细分。

SSD正向计算侧和大容量侧同时延伸。慧荣科技让控制器依据任务和QoS动态分配资源,以适配规划阶段的低时延、检索阶段的高吞吐和执行阶段的高带宽;闪迪将SSD分为直连GPU、网络连接GPU及集群外三类,分别承载热KV、高规模计算数据和低频大容量数据。北美大型互联网公司还开始以大容量QLC SSD替代部分HDD;大数极限设计的PMD则通过并行、多路队列、聚合、预取和缓存提升机械盘能力。AI SSD测试也加入深度学习I/O、KV Cache和断点恢复场景。

NAND也在突破传统边界。三星Z-NAND以SLC Die和TSV提升读取性能,将模型权重放入其中,而把操作系统和KV Cache留在DRAM。北京大学等团队探索HBF高带宽闪存,包括缩小阵列降低时延、增加接口提升并行度两条路线,但仍面临密度、读取速度和写入寿命问题,并尝试利用NAND阵列开展存内计算。

未来分层管理将从“上层不够再下沉”转向主动调度。存储、连接和软件解决方案分别负责介质选择、稳定传输与应用适配;联芸和寅谱的方案把常用MoE专家权重留在内存、暂不用的放入SSD,并预测后续调用内容进行预取,高频KV Cache留在内存、低频部分下沉。杰创智能则在集群层面按任务、GPU代际和网络带宽匹配数据与算力。数据能否及时抵达计算单元,正成为决定算力产出的关键。

AI推理存储SSDNAND数据分层

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文