香港中文大学等团队提出COBRA-Skills方法,仅用50个样本将Agent技能优化成本降低55%至58%
过去,智能体的技能大多依赖人类专家手动撰写,不仅耗时费力,更难以覆盖海量复杂的真实场景。为此,借助大模型自动化生成与优化技能,成为让Agent迈向自主进化的新范式。然而,摆脱人工束缚后,却面临高昂的Token账单。验证一个自动生成的技能是否有效,必须让智能体在真实任务中执行,每一次试错都消耗Token和时间。
针对这一问题,香港中文大学深圳等高校研究团队在论文中提出COBRA-Skills,将技能优化转化为带预算控制的情境多臂老虎机问题。论文链接:https://arxiv.org/abs/2609.11682
COBRA-Skills摒弃盲目堆叠Token的演化路线,巧妙地将技能优化转化为带预算控制的情境多臂老虎机问题。它在真实评估前增加收益预判机制,确保只有最具潜力或探索价值的候选技能进入实际演练,并结合精细化算子迭代种群。凭借高效筛选策略,仅用50个优化样本,将优化成本降低55%至58%,在6个跨领域Benchmark上实现对现有主流方法的全面超越。
团队设计双轮闭环:老虎机负责筛选,进化负责重构。系统维护技能种群,每轮先由老虎机算法为每个技能打分,挑选最高者;然后实战检验,在优化集上执行任务返回奖励与轨迹;最后反馈更新历史数据,并触发进化更新淘汰低分技能并生成新技能。
引入老虎机将Token消耗拦在评估之前。团队采用两层MLP预测收益,并结合LinearUCB量化探索,最终优先级分数为预测奖励加探索奖励。每轮仅挑选得分最高者送入评估,低质技能被过滤。
基于轨迹证据演化,告别全局重写。进化机制采用对数调度触发,避免频繁调用高阶LLM。每次更新淘汰最低m个技能,由再生、轨迹变异、交叉重组三种算子生成新技能。团队强调保守局部修改,以保护原有结构。
在6个异构基准上验证,包括SearchQA、SpreadsheetBench、DocVQA、LiveMath、SocialMaze和ALFWorld。COBRA-Skills在三个目标模型上均取得最高平均性能,相比无技能基线大幅提升,并在成本上与SkillOpt相比降低55%-58%,教学Token节省67%-80%。
在成本控制上,总优化成本降低55%-58%,教学模型Token消耗大幅缩减67%-80%,每单位性能提升的成本降低60%-69%。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文