美联航客服机器人积分有效期错误暴露 Agentic AI 生产风险
美联航的客服聊天机器人向客户 Alison Gil 告知,她价值 200 美元的旅行积分将在存入之日起五年内有效,但联合航空随后表示该积分实际将于 2026 年 9 月 27 日到期。这一事件暴露了 Agentic AI 在真实业务场景中的风险失控问题。
Gartner 2025 年 6 月预测,超过 40% 的 Agentic AI 项目将在 2027 年底前被取消,原因之一是风险控制不足。Scale AI 在论文中指出,一个 AI Agent 在基准测试上表现出色,却仍不适合部署。
许多企业习惯在采购环节优先评估模型选用问题,但行业实践表明,模型只能代表能力,外围系统才是生产力。2026 年,行业先后给出了 Harness Engineering 和 Graph Engineering 等新概念。
Harness Engineering 强调 Agent = Model + Harness,Harness 包括循环控制、工具调度、记忆、护栏等。Graph Engineering 则讨论将多个 Agent 编排成图,实现系统级智能。
但这些概念回答了“怎么造”的问题,尚未解决上线后的可靠性。亚马逊云科技在 GTLC 全球技术领导力峰会上海站分享了《企业生产级智能体开发部署指南》,提出 Agent DLC 概念。
Agent DLC 包含六个环节——定义、构建、评估、发布、观测、回流,形成闭环。其中“发布”是关键门,团队在评估环节高频迭代。
黄金标准由评估规范和黄金轨迹集构成。评估规范将要求转化为五个维度的判据:认知、质量、责任、成本、性能,每条判据分红线、门禁、观测三档要求。
评估是 Agent DLC 中最关键也最易出错的一环,因为它同时承担质量判断和放行决策。传统软件测试有确定性对错,而 Agent 输出是自然语言组合,“什么算对”需定义。
白皮书指出评估依赖 LLM 做裁判,易有偏差,如位置偏差、冗长偏差等。对策包括交叉验证和改变评分标尺。
亚马逊云科技提供实用工具:四格二分法快速定位根因,通过四个问题排查检索、生成、知识、意图问题。三级归因将“不通过”转化为具体修复方向,包括会话级、轨迹级、步骤级。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文