产品派
返回

外滩大会聚焦Agent后训练与下一个Scaling Law

AI雷锋网2026/9/12 16:40:00
AI 导读

当大模型开始调用工具并执行复杂任务,能力评价正从“能否答对”延伸到能否在真实环境中持续行动、检查结果并依据反馈调整策略。9月12日上午,2026 Inclusion·外滩大会举行“Agent Post-Training:智能本质与下一个 Scaling Law”见解论坛,围绕算法、环境、基础设施和自我进化展开讨论。与会者关注的共同问题是:如何让Agent完成复杂工作,并在工作过程中沉淀经验、发现知识,再反过来推动模型能力提升。

CAMEL AI创始成员谢钰溱在《通往agent时代的范式跨越》中,将Agent Scaling Law概括为数量、环境和进化三个相互关联的方向。数量增长不只是增加Agent数量,还涉及通信、共识和无中心控制下的自组织;环境则类似模型训练中的数据,任务从推理扩展到跨设备操作、长流程工作乃至机器学习研发后,环境构建、结果验证和防止奖励机制被利用都更重要。她认为,让现有模型参与研发并推动下一代模型训练,可能成为智能体进化和探索新Scaling Law的重要路径。

蚂蚁百灵大模型负责人周俊表示,真实任务覆盖编程之外的医疗、金融和法律等专业领域,蚂蚁百灵3.0(Ling-3.0)希望在可控成本下持续发展专业能力。Agent需要同时具备高质效、可专业化和可信执行:既要平衡质量、成本、等待时间与成功率,也要理解专业语境、调用工具并遵循流程,还要识别风险,在证据不足、权限不够或错误影响过大时请求人工接管。医疗场景强调补齐信息、循证检索和表达不确定性;金融投研则要求完成检索、分析、建模和报告生成,并标明来源、统一口径、区分事实与假设。真实场景还必须沉淀失败案例、专业评测和可交互环境,才能转化为训练能力。

英伟达研究员胡健介绍了面向研究的强化学习框架Molt。该框架基于PyTorch原生能力,核心代码约9000行,旨在降低修改优势估计、损失函数、数据过滤和训练流程的门槛,也便于编程Agent理解并参与算法研究。Molt支持传统环境交互和外部Agent框架,可追踪交互轨迹、处理前缀变化与长任务样本拆分,并通过流式采样和调度让数据采集与训练持续并行,提高GPU和环境资源利用率,目前已支持多种主流模型及大参数规模训练。

美团LongCat主任研究员、通用Agent团队负责人顾奇将重点放在长程任务上。他把任务分为循环迭代型和系统性任务:前者依靠可验证反馈反复优化,后者包含多层子任务和复杂依赖,常常要到整体完成后才获得完整反馈,因此需要任务分段、过程指导和中途更新。支撑Agent运行的Harness包括交互界面、信息管理和推理脚手架;即使模型能力增强,环境交互与信息管理仍会持续存在。任务难度还取决于工具依赖、推理深度广度和交互噪声,团队正通过评测拆解难度并逐步自动化环境建设。

新加坡国立大学博士生孙彦以长视频生成为例,讨论如何在十几分钟甚至小时级视频中兼顾效率、角色一致性和叙事连贯性。团队把用户需求、故事设定、剧本和制作方案整理为可保存、检查和更新的结构化信息,并将“拍什么”与“如何实现”分开。系统依据素材和片段依赖关系建立生成依赖图,安排并行制作、分阶段校验,发现问题后追溯节点并局部返修,同时优先处理影响整体衔接和观看体验的错误。随着规模扩大,前期规划和文本校验的重要性进一步提升。

清华大学人工智能学院助理教授、超衍智能创始人陈勇超则把自进化目标推进到自主发现。模型进入陌生环境后,除了复现已有知识,还应提出假设、开展实验并验证新想法;榜单更强的模型并不总能产生更有新意的研究方向,科研场景需要保留试错空间。由于论文通常只呈现最终结果,团队组织了约100个跨领域研究项目来积累研究轨迹,并探索让AI生成数据、配置实验环境、执行实验和撰写论文,再将轨迹用于后训练。当前仍需提高思维多样性,并解决AI并行产出增加后成果验证和专业判断能力不足的问题。

智能体Agent后训练Scaling Law强化学习自主科研

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文