浪潮信息发布元脑SD200 Ultra与HC2000多元算力机组
在人工智能智能体(Agent)快速普及的背景下,算力调用逐渐由传统的单次脉冲式问答转变为长时间、高频次的连续推理。随着任务执行频次激增、单任务Token消耗量攀升以及多智能体协同链条延长,算力需求呈现出爆发式增长态势。
行业报告预测,到2030年全球算力缺口绝对值将扩大至3809亿美元。面对不同推理阶段动态变化的计算特征,单纯依靠增加芯片和扩大集群规模的传统堆料方式已难以奏效,反而容易导致硬件资源配比失衡与算力闲置。
针对算力体系面临的能力上限与规模产能两大瓶颈,业内提出了能力型智算与容量型智算的发展方向,前者旨在支撑复杂前沿模型的长链条高难度计算,后者则致力于通过多元架构优化成本,让算力供给更加充裕普惠。
为应对前沿大模型单节点承载与运行难题,浪潮信息在AICC2026上推出了元脑SD200 Ultra超节点AI服务器。该产品采用紧致扩展架构,整机集成128颗芯片、8TB显存与64TB扩展存储,不仅可高效运行2.8万亿参数模型,还具备单机部署10万亿参数模型的扩展潜力。
针对大规模芯片协同的通信延迟,该服务器引入全局统一编址与对称直连技术,使跨卡访问无需经过缓冲区中转即可直接读写远端显存,将All to All通信时延压减至0.69微秒,达到行业主流超节点水平。
在计算优化与运行稳定性方面,SD200 Ultra运用软硬件融合的超级算子技术,使模型推理性能提升超过3倍、Token生成时延低至5.85毫秒,同时采用铜互联方案减少光电转换环节,降低复杂长任务的中断风险。
面向Token产能与成本挑战,浪潮信息同步发布了元脑HC2000多元算力机组。该机柜采用全液冷与高通流供电架构,单柜供电超300千瓦,最高可部署256张AI加速卡,柜内聚合带宽达200Tbps,算力密度达到传统风冷机柜的4倍。
HC2000支持将不同特性的计算芯片与推理阶段解耦匹配:在Prefill阶段使用高算力芯片,Decode阶段调用大容量高带宽内存芯片,FFN环节则接入3D RAM堆叠芯片,实现各类硬件资源的精细化分工协同。
配合硬件架构,MCIS多元算力协同推理软件栈实现了从请求路由到算力动态调整的全链路优化。通过冷热分级存储与点对点直传技术,存储传输瓶颈得到突破,使得该机组在典型智能体任务中实现同等投资下10倍的Token产能提升。
能力型计算拓展了AI能够探索的问题边界,而容量型计算则将高阶能力快速工程化并低成本普及。二者相互驱动形成的螺旋演进,正在推动智算产业从单纯提供算力迈向高效生产智能的新阶段。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文