产品派
返回

快手分享智能运维助手事件驱动与自进化实践

AIInfoQ 中文站2026/9/16 11:15:09
AI 导读

AI正从回答问题的工具,逐步变成能够自主规划、调用工具并执行任务的软件系统。随着推理模型、Coding Agent、Agent Runtime和Agent Framework持续发展,工程重点也从单纯训练、部署模型转向建设稳定、可信、可控的AI Native系统,系统级架构、安全与可观测能力成为关键。

2026年QCon全球软件开发大会上海站将于10月22日至24日举行,议题覆盖AI Native架构、Agent Runtime、AI Infra、数据系统、Agent安全与可观测、Loop Engineering、Vibe Coding、具身智能、世界模型及端云协同等方向。大会计划设置20个专题论坛,邀请100多位来自不同领域的技术专家分享AI从实验走向生产的实践。

快手AgenticOps研发负责人、高级技术专家吴垚将参与“AI Agent可观测与持续改进工程”专题,分享《从接住告警到自我进化:快手智能运维助手实践》。快手没有简单地把指标、日志、Trace、变更和CMDB接入一个问答界面,而是把告警、巡检、变更和应急等运维事件作为核心对象:事件触发后,由确定性流程先完成上下文预取,再交给Agent进行归因推理和方案生成,并持续更新事件状态。目前,这套体系已应用于多条核心业务线的大盘巡检、告警初判和应急定位场景。

吴垚主导了快手运维Agent从零到一的建设,并探索了自进化体系。演讲将分析为何工具齐全仍难降低运维负担、为何Agentic AIOps首先要解决上下文来源问题,以及事件驱动架构为何比单纯对话入口更适合运维场景。同时还将介绍Skill与记忆的双层沉淀方式:Skill承载流程,记忆保存结论,作用域绑定团队而非个人,并讨论经验提取、召回、迭代和评测机制。

实践中的难点包括上下文过多会稀释关键信息、过少又可能导致错误归因;人工维护的知识和Skill还会因架构演进而逐渐失效。快手将自进化对象放在结构化运维经验,而非模型权重上,反馈只写回可对比、可审计、可单独回滚的经验资产,从而追踪每次改进或退化的具体变更。由于运维时序数据会过期,评测不能只看准确率、时延或步骤完成率,后续还将扩大自主处置边界,在风险可控前提下减少人工介入。

智能运维AgenticOpsAIOps可观测性AI工程

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文