产品派
返回

华为昇腾960超节点实现4096卡互联

AIInfoQ 中文站2026/9/23 22:05:39
AI 导读

华为于9月17日发布昇腾960超节点,这是全球首个采用NPO(近封装光学)技术的超节点,最多支持4096张卡,面向十万亿参数规模大模型的训练与推理。其核心目标不是简单堆叠计算卡,而是通过高速互联和跨物理节点统一内存编址,让多个节点在软件层面更接近一台计算机。

在传统服务器架构中,集群通信可能占据训练时间的40%以上,卡的数量增加并不意味着任务能够同比提速。华为仿真数据显示,在十万卡规模下,由4096卡超节点组成的集群,相比采用8卡服务器的方案,模型浮点算力利用率(MFU)提升2.75倍。昇腾960使用灵衢UnifiedBus统一连接计算、互联和管理组件,围绕该体系配套了11颗关键芯片,以减少协议转换和跨节点访问带来的损耗。

互联硬件方面,华为将光引擎部署到更靠近主芯片封装的位置,以缩短高速电信号路径,缓解信号损耗、完整性和功耗压力。Hi-ONE单个光引擎传输容量达到7.2T,并采用内置光源。整套方案以约5500个光引擎替代48000个800G光模块,官方称可降低超过550kW功耗,并使系统无故障运行时间翻倍。不过,近封装光学也带来了更高的布局、散热和可靠性要求,需要同时平衡光、机、电、磁、热等设计约束。

昇腾960超节点采用正交架构和全液冷方案,峰值算力最高达到8 EFLOPS FP8。华为计划让昇腾960DT在2027年第一季度就绪,960PR则计划于同年第三季度就绪。与之同步升级的鲲鹏超节点同样最多支持4096个节点,并基于灵衢进行全光组网,重点服务Agent执行环境等通用计算场景。

在十万级Agent沙箱启动测试中,鲲鹏超节点相较传统服务器方案可实现30倍启动性能提升,沙箱密度提高25%。这类能力能够缩短依赖安装、文件读取和工具调用等环节的等待时间,改善大量Agent并发运行时的环境供给与调度效率。

软件生态方面,CANN已全面开放并进入常态化社区运作。华为披露,外部开发者占比达到61%,社区月活开发者超过5200人;基于昇腾与CANN原生训练的模型已超过40个,平台覆盖PyTorch、Triton、vLLM、veRL等90多个主流第三方社区。昇腾960仍需经过产品交付和实际负载验证,但此次布局显示,华为正从芯片、互联、光通信、散热到开发工具链协同推进超大规模AI基础设施。

昇腾超节点AI基础设施光互联CANN

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文