产品派
返回

真武AI芯片软件栈进一步扩大开源范围

AI量子位2026/9/25 18:00:14
AI 导读

9月22日云栖大会上,阿里巴巴集团CEO吴泳铭介绍新一代真武V900,称其性能达到M890的3倍。次日,平头哥公布AI软件栈T-Head SAIL的最新开源进展,扩大框架适配、加速库、工具链和通信库等开放范围。

对于芯片客户而言,软件生态决定了既有代码、工具和调优经验能否延续。真武AI芯片目前已服务20多个行业、650多家客户,蚂蚁、小红书、小鹏汽车等企业已使用SAIL。小红书还基于开源代码开发模型迁移与算子优化Agent,加快生成式推荐模型部署。

T-Head SAIL可视为面向真武芯片的类CUDA软件栈,连接PyTorch等上层框架与底层硬件,承担模型迁移、编译执行、计算加速和调试工作。7月WAIC启动开源时,项目已提供SDK、驱动、性能分析工具、调试工具和技术文档。

此次公布的开源项目包括PyTorch-for-sail框架适配、sailify源码迁移工具、Triton-for-sail算子开发工具,以及DeepGEMM-for-sail、FlashAttention-for-sail等加速项目。开发者可以查看并修改实现,尽量保留原有业务积累,降低更换芯片后的迁移成本。

迁移成功只是起点,若模型效率大幅下降,仍难以满足生产需求。相关加速项目开放后,业务团队可以结合自身模型和负载定位瓶颈、优化算子,减少所有问题都依赖芯片厂商处理的情况,让更了解模型的开发者直接参与性能调优。

新模型快速适配也是客户关注重点。按现场披露数据,截至2026年9月,平头哥已在ModelScope提供39个量化模型,覆盖Qwen、DeepSeek、Kimi等系列,累计下载超过34.8万次。TensorFlow、JAX适配版本、自研推理引擎,以及PCCL、DeepEP-for-sail等组件也在推进开源。

小鹏已借助SAIL将GPU平台上的业务模型迁移至真武云端集群,用于智能驾驶模型训练,并利用性能分析工具继续优化。SAIL支持C++、Triton和TileLang等开发方式,减少团队重新学习的成本。

蚂蚁推理服务团队已在真武810E和M890上完成主要前沿模型适配,并持续推进量化、推理阶段分离、专家并行负载均衡和稀疏注意力等优化。小红书则把迁移与算子优化经验封装进Agent,以自动化方式辅助模型部署。

SAIL建立了问题反馈、代码修改、提交贡献、自动化测试及维护者和社区评审流程,合格改进可并入主线。开源后已有阿里内部团队和外部客户贡献代码,社区还提出增加硬件架构信息、加快新模型和新框架支持等需求。

扩大开放的基础是芯片已完成多轮交付和实际验证。从2019年含光800、2021年倚天710到真武系列,产品先在阿里业务中验证,再通过云服务外部客户。真武M890完成两代芯片交付后,软件成熟度和客户二次开发需求共同推动开源。平头哥还计划将适配成果逐步提交至PyTorch、vLLM、Triton等上游,以减少独立维护成本。此举也服务于阿里长期投入模型、芯片和云的AI布局;阿里此前宣布三年投入至少3800亿元建设云和AI基础设施,并正与千问团队探索生成高性能算子。

AI芯片开源软件栈真武模型迁移阿里云

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文