产品派
返回

GLM-5.3驱动Infra Agent完成十万卡集群优化

AIInfoQ 中文站2026/9/18 17:01:53
AI 导读

智谱创始人、首席科学家唐杰与GLM团队披露,GLM正从辅助工程师编程,进一步参与人工智能基础设施的建设。以GLM-5.3-Flash为例,由模型驱动的Infra Agent在超过10万张国产芯片组成的集群上完成模型适配、系统诊断和性能优化,不到两周便将端到端吞吐提升至初始基线的3倍。团队认为,这尚不是完整的递归自我改进(RSI),但已经出现了早期迹象。

这项工作面向的是生产级推理服务。此前,超大规模国产芯片集群缺乏成熟部署经验,还面临内存容量和带宽有限、算子生态不完善,以及1M上下文窗口和多模态请求支持困难等问题。Infra Agent通过测试、Trace和Benchmark等稠密反馈自主提出假设、修改代码并验证结果,使GLM-5.3-Flash最终能够在这套系统上运行全部线上推理。

上线后,该模型曾以匿名模型Ox-Alpha在OpenCode和OpenRouter接受真实调用检验,上线一周成为两个平台调用量最高的模型,6天累计Token调用量超过62万亿。优化过程中采用了以计算换带宽、以通信换显存等方案,技术栈包括线性注意力与LM Head的节点内张量并行、ReplaySSM、W8A8量化、INT8/FP8/BF16混合精度缓存量化和Layer Split,并引入Encode–Prefill–Decode(EPD)分离架构,使硬件利用率和单Token成本达到主流英伟达GPU的相当水平。

团队指出,Agent的工程效果不只取决于代码生成能力,还依赖能否获得持续、细粒度且可归因的反馈。单纯告知“精度测试失败”、首Token延迟增加30%或吞吐下降20%,无法说明问题究竟来自算子、并行、通信、内存还是调度。因此,系统将正确性测试、运行日志、执行Trace、运行时事件、微基准和端到端指标组织为可反复执行的工作流,让Agent能够针对具体假设选择验证手段。

所谓稠密反馈,重点不是堆积更多日志,而是让反馈足够局部、及时且能够客观验证。它应关联到具体代码、算子、输入条件、线程或执行区间,并通过参考实现、控制变量实验和可比较指标判断修改是否有效。局部测试用于快速排除错误方案,端到端测试则检验局部收益能否转化为真实服务收益,工程师、Agent与实验环境由此形成持续迭代的优化闭环。

在正确性验证方面,团队将推理引擎的并行策略映射到具体算子实现,把部署配置转换为可逐项检查的任务。Agent需要明确输入如何切分、涉及哪些算子以及哪些计算路径应与非切分实现对照,从而避免只验证单个算子在简单条件下的结果。团队还表示,GLM此前已在真实代码库中发现数千个漏洞,因此为这类高能力模型设计了受信访问机制;若趋势持续,模型未来可能获得自主设计并训练继任系统的能力。

GLM递归自我改进推理基础设施国产芯片AI安全

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文