产品派
返回

Atlassian提出自动化根因分析方法

工具InfoQ 中文站2026/9/20 11:04:48
AI 导读

Atlassian提出了一套面向大规模云原生事故的自动化根因分析方法。该方案把指标、日志、分布式追踪和服务拓扑放在同一分析框架内,自动生成关于故障起源位置、影响范围和传播路径的排序假设,目标是减少工程师在多个仪表盘与工具之间手动拼接线索的时间。

这套系统将事故排查视为跨信号、跨时间和跨拓扑的关联问题。它不会要求值班人员先逐项查找异常,再人工重建依赖链,而是分别识别各类遥测数据中的异常,将结果对齐到统一时间线,并结合服务依赖图进行推理,最终给出可能根因、传播顺序及相关证据。

在缩小分析范围方面,系统依托OpenTelemetry构建服务地图,只关注与受影响用户路径相关的服务子集。该依赖关系来自真实生产流量,通过追踪跨度之间的父子关系呈现服务之间的实际调用,而不是依赖可能滞后的静态架构文档。

不同类型信号会采用不同检测策略:指标侧关注请求速率、错误率和延迟变化;追踪侧分析异常、耗时和调用结构变化;日志侧则通过分组识别新出现或异常增加的错误模式。随后,这些检测结果会被转换成统一的异常格式,用于后续关联和排序。

系统会把时间上接近的异常归为潜在故障序列,例如数据库异常之后出现应用超时和前端报错,可能被判断为同一事故的连续表现;同时,它还利用序列指纹对反复出现的故障模式去重。由于单纯时间接近并不能证明因果关系,系统还会结合服务依赖方向和异常出现先后,从受影响服务向上游追踪,以定位更可能的源头。

输出结果不是简单列出异常清单,而是概括疑似原因、受影响服务和支撑性遥测证据,供工程师复核后采取修复措施。Atlassian还在探索引入基于LLM的编排能力,让智能体能主动请求额外遥测数据、比较多个假设并动态调整排查路径;同时也强调,这类系统需要在速率限制、执行环境和证据来源上设置管控,保持可解释性并基于真实数据,而不是生成看似合理的猜测。

可观测性云原生根因分析OpenTelemetry

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文