产品派
返回

openJiuwen发布RSI框架推动智能体持续自我优化

AIInfoQ 中文站2026/9/14 14:01:25
AI 导读

随着智能体承担更复杂、更长期的任务,让其从执行结果中学习并持续改进成为新的研究方向。针对2024年至2026年1250篇论文的综述显示,AI自我改进已覆盖部署行为、训练策略、评估器以及AI研究流程。由华为相关实验室、华为云、终端和计算团队联合构建的开源平台openJiuwen,继6月推出可自动优化Prompt、Skill、Tool和Rail的Auto Harness后,又发布了完整RSI框架。

该框架把优化对象划分为两类:Harness决定智能体如何工作,Artifacts则代表最终交付物,目前包括科研论文和算法程序。系统先建立基线,再依据失败案例、执行轨迹和评测指标定位问题,生成候选版本并重新执行;只有验证有效的修改才会被采纳,成功与失败经验都会进入下一轮。框架已接入WorkSwarm蜂群办公智能体,并通过算力亲和降低反复生成、执行和评测的成本。

RSI框架由任务、迭代优化、执行和基础框架四层组成,分别负责定义目标与资源、选择改进方向、运行任务并返回证据,以及提供模型上下文、沙箱、状态恢复和可观测性。流程包含建立基线、分析问题、生成候选、采纳融合、沉淀经验、归档停止六个阶段。AgentLoop处理单次推理—行动—观察—反馈,控制器负责跨版本优化;每份证据都绑定版本和评测环境,候选必须重测,失败、无效证据及未采纳原因也会被记录。论文优化可用Frontier选择父版本,程序优化采用PUCT搜索,Harness则依据任务轨迹改进自身配置。

WorkSwarm的“实验”模式支持Harness和产物优化。Harness实验先准备包含任务、评测方式、参考答案及评分规则的JSON数据集,再选择模型、初始插件、评测集和最多迭代轮次。系统会从失败用例中生成Prompt、Skill、Tool、Rail候选,先验证修复效果,再回放完整数据集;有效版本可一键安装为插件并支持回退。在DeepSeek-V4-Flash任务模型、最多5个Epoch的设置下,SWE-bench Lite Dev的23题通过率由61.0%升至87.0%;冻结优化后的Harness后,Evo-Bench General的64题通过率由60.9%升至71.9%。

论文优化支持从研究构想或本地论文继续迭代,页面会展示版本树、分数、改动及未采纳原因;程序优化则通过包含初始代码和scorecard等信息的任务包搜索候选版本,可暂停、续跑并下载最优结果。为降低重复计算,算力亲和机制利用Agent Hint感知任务状态,在昇腾NPU显存、鲲鹏CPU内存和远端缓存池之间调度KV Cache。相关实验显示,TTFT均值下降15.83%、P90下降19.16%,Token加权缓存命中率由7.53%升至14.36%,HBM和DDR峰值使用率分别下降22.82%和30.74%。

目前,openJiuwen已形成从实验创建、候选生成、验证采纳到经验复用的完整链路:Harness优化智能体的工作方式,Artifacts优化论文和程序等成果,算力亲和则减少多轮迭代的资源开销。后续还将扩展搜索、评测和融合算法,增强跨任务经验复用,并接入模型优化与混合优化能力。

智能体自我改进开源平台算力优化

本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。

阅读原文