产品派
返回

香港科大袁彬航分享AReaL 2.0 Agent学习闭环

AIInfoQ 中文站2026/9/18 12:09:43
AI 导读

随着推理模型、Coding Agent和Agent Runtime持续发展,AI正从回答问题的工具转变为能够规划、调用工具并执行任务的软件系统。2026年上海站大会将于10月22日至24日举行,聚焦AI Native架构、Agent基础设施、数据系统、安全与可观测性、Loop Engineering、具身智能及端云协同等方向,讨论AI从实验走向生产的工程方法。

香港科技大学计算机科学与工程系助理教授袁彬航将围绕AReaL 2.0发表主题分享。该方案针对生产环境中Agent交互轨迹、工具调用记录和用户反馈难以转化为训练数据的问题,引入Agent轨迹协议、Agentic Data Proxy与Agent Evolution Control Plane,并以微服务化Agent-Compute架构连接现有Agent和Online RL系统。在Hermes Agent及软件工程Agent场景中,它支持大规模并发环境、异步训练和持续优化,减少对原有工作流的改造。

分享将解释Agent为何需要从执行闭环走向学习闭环,并介绍如何把包含状态、动作、反馈、奖励和环境信息的日志升级为可训练、可回放、可治理的学习轨迹。控制平面可根据失败原因选择Memory、Harness或模型参数等优化对象;Gateway、Router、Data Proxy和Agent-Compute Worker则负责解耦服务与训练,通常只需替换推理入口即可接入真实交互训练。袁彬航曾获2019年VLDB最佳论文提名奖和2020年SIGMOD研究亮点奖。

实践中,Online RL面临环境变化、模型回归、奖励设计和故障归因等问题。用户行为、工具版本与任务分布变化,可能使一次更新改善部分任务却损害既有能力,因此需要回放评估、灰度发布和快速回滚。奖励还要同时考虑任务完成率、工具效率、成本、安全与满意度,避免过度简化导致奖励投机。Agent自演进也不只是改模型,还需区分Prompt、Memory、Tool、规划策略等模块的责任。

与只关注训练过程的RLHF或RLVR不同,AReaL 2.0强调从生产交互、轨迹分析、失败归因到能力更新的完整治理闭环,帮助团队在学习速度、可靠性和治理成本之间取得平衡。大会还设置Loop Engineering、Agent自主进化、Agent as a Service、Vibe Coding、AI SRE和AI Infra等20个专题,预计邀请100余位专家分享实践。详情可通过票务经理18514549229咨询。

Agent在线强化学习AI基础设施AReaL 2.0大语言模型

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文