LLM评估闭环引入双层校准与自动回滚机制
AI 系统正从回答问题的模型,演变为能够自主规划、调用工具和执行任务的软件系统。2026 年 QCon 全球软件开发大会上海站将于 10 月 22 日至 24 日举行,聚焦 AI Native 架构、Agent Runtime、AI Infra、数据系统、安全与可观测、Loop Engineering、具身智能、世界模型及端云协同等方向,议程包含 100 多个从实验走向生产的案例。
阶跃星辰开放平台产品负责人陶炳哲将在“AI Agent 可观测与持续改进工程”专题分享 LLM-as-Judge 的自我校准方案。他认为,很多 Agent 只能“跑通一次”:上线后可能输出完整却不达标、重复调用工具消耗 token,或结果正确但执行越权。案例包括自动生成并持续优化会议纪要,以及支撑模型权限“申请、开通、通知、日报”的开放平台流程。系统用生产 checker 全量评分,另由盲评 Meta-Evaluator 抽样;当 94 分与 85 分的差距超过 8 分,就自动重校 rubric。每周再由 Planner、Generator、Evaluator 进行单变量对抗迭代,配合快照晋升、回滚和 HUMAN_GATE。
陶炳哲曾负责阿里云和字节跳动的可观测产品,目前关注模型路由与 token 商业化。其设计框架可归纳为八问:目标与完成态、触发调度、上下文与 Skill、工具分工、隔离安全、记忆状态、评估观测、身份权限。顺序是先定义成功,再设计执行,最后补充护栏;Evaluator 只输出 PASS、REWORK 或 ESCALATE 及修改建议,有副作用的动作必须具备幂等键,并按任务重要性平衡模型成本与可靠性。
生产实践暴露出多类问题:仅把去重、格式和幂等写入 prompt 可能失效,需由代码兜底;写接口可能返回成功但实际未更新,必须写后复核;零输入的静默成功要有显式状态;快照会同时耗尽磁盘容量和 inode;凭证过期、额度用尽等故障要区分可自愈状态与真实失效。轮询增量还存在并发和跨日数据漏重风险,放宽去重窗口又会牺牲及时性。
演讲还将讨论评估成本、裁判漂移、自然语言约束与自进化稳定性的矛盾。双层评估可能令 token 成本接近翻倍,盲评抽样最多带来 24 小时发现延迟;增加评估层也不能替代人工闸门。三类隐性失控包括过早宣布完成、装忙式死循环、结果正确但过程越权,对应监控结果质量、状态推进和过程合规。生产系统还应具备可恢复运行载体、Agent Identity、默认无权限且临时授予的最小权限,以及覆盖模型、Prompt、工具、授权主体和成本的全链路审计。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文