蚂蚁架构师分享Agent实时评估实践,令牌成本可降90%
随着推理模型、Coding Agent和Agent Runtime持续发展,AI正从提供单项能力的模型演变为能够自主规划、调用工具和执行任务的软件系统。工程重点也由训练、部署模型和优化提示词,转向让具备自主能力的AI稳定、可信、可控地运行。2026年QCon全球软件开发大会上海站将于10月22日至24日举行,围绕AI Native架构、Agent Runtime、AI Infra、数据系统、安全与可观测等方向,分享AI从实验走向生产的工程实践。
蚂蚁集团架构师刘杨将参加“AI Agent可观测与持续改进工程”专题,并发表主题演讲。针对传统日志、指标和Trace难以判断Agent是否完成任务、难以定位质量问题的情况,他将介绍一套企业级可观测与评估体系:采集层遵循OpenTelemetry GenAI语义约定,统一模型调用、工具调用和Agent执行过程的遥测数据;评估层以Trace为核心,通过实时管线完成任务筛选、信息提取和自动评估,延迟可达到分钟级。声明式表达式还能降低不同业务Agent的接入成本。两阶段机制先用小模型进行粗筛,再由大模型精筛,可减少90%的Token成本,使安全、合规等底线指标覆盖全量生产流量成为可能。
刘杨目前负责蚂蚁可观测技术架构相关工作,参与过产品、告警、计算和元数据等技术栈建设,并具备大型分布式计算系统性能优化经验,近两三年重点研究推理引擎与Agent可观测。他的分享还将涉及统一GenAI埋点、Span聚合、评估任务配置、Trace关键信息提取、结果沉淀,以及通过表达式适配不同Trace结构;同时探索关联Agent链路与模型推理过程,在Token粒度分析生成时序、推理性能,并结合Token概率分布和熵等不确定性信号进行质量分析。
实践中,两阶段评估依赖适合业务场景的小模型,而这类模型往往需要专门训练,建设成本并不低。要实现从Agent Trace到推理引擎的跨层观测,也需要对推理引擎增加埋点。相关案例将展示标准化采集、评估配置、生产运行、问题发现、原因定位和质量改进的完整流程,并讨论其中的工程取舍。
大会还设置Loop Engineering、千行百业Agent创新实践、Agent自主进化、Agent as a Service、Vibe Coding质量、AI安全可靠性、金融AI Native、AI Infra和AI Native架构等20个专题论坛,预计有来自不同企业和行业的100多位专家分享实践。参会者可据此了解如何从标准化GenAI遥测和Trace进一步构建实时质量评估、规模化生产运行及深度问题定位体系。咨询电话为18514549229。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文