产品派
返回

DeepSeek开源昇腾组件推进AI芯片生态协同

开源量子位2026/9/30 10:53:17
AI 导读

9月30日,DeepSeek面向昇腾算力平台开源基础设施组件,内容覆盖TileLang高级语言编译工具、高性能计算库和分布式通信库,与其此前面向GPU平台开放的相关组件形成对应,为国产AI芯片软件生态增加了新的基础设施选择。

此次开放的组件包括DeepGEMM、FlashMLA、TileKernel、DeepSelect等高性能算子库,以及DeepEP分布式通信库。昇腾提供开放的Ascend C接口,开发者可以针对访存路径和计算流水线进行深度调优;结合Ascend C与PTO ISA底层指令体系,也支持TileLang编程和编译对接,兼顾手工优化与高级语言开发模式。

在集群互联方面,华为与DeepSeek联合定义了昇腾超节点SuperPoD Flex及UBL128组网方案,支持128卡、3.2Tbps单层交换的Scale-up网络,以及最多256K卡的两层交换Scale-out网络,面向低时延推理和大规模模型训练。基于UBL128超节点,昇腾还提供ASC-COMM通信编程库;DeepEP则覆盖EP、CP、PP、FSDP等模式,实测Dispatch带宽375 GB/s、Combine带宽347 GB/s,接近硬件能力上限。

相关联合成果已在CANN社区开放,覆盖昇腾950及超节点集群上的大EP低时延推理、单卡和单机部署、大规模训练、超长文本KV Cache池化及Agentic RL等实践,同时提供通信编程、融合算子、量化训练、LoRA微调和Agent部署调优等技术文档。

在EP32部署策略下,DeepSeek-V4.1-Flash离线推理、不含框架的纯模型测试中,TPOT为5ms时单卡输出吞吐达到2469 tokens/s,TPOT为10ms时达到5102 tokens/s。测试采用128K ContextLength,Dspark投机接受率为0.85,数据未计入Serving调度和框架负载均衡影响。

双方表示,后续将继续推进芯片与模型协同优化,打通从推理到训练的全链路,并通过开放接口、算子、通信库和部署实践,建设更高效、易用的AI软件生态。

大模型昇腾平台算子库分布式通信开源

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文