MetaRSI统一三类自我改进小模型平均提升10.9分
CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余所高校发布MetaRSI-v1。该系统首次把Model-RSI、Data-RSI与Harness-RSI纳入统一的元递归架构,在没有外部教师模型参与的情况下,优化“自我改进”本身。
在四项基准测试中,3B激活参数的小模型平均提升10.9分;GPT-5.6、Claude Opus 5等六款前沿模型也平均提升7.3分。项目提出一套包含Loop Kernel、两条编排轴、三个算子、元RSI层和五条定律的统一框架。
Loop Kernel将自我改进抽象为通用闭环:系统从执行反馈中提取学习信号,修改Data、Harness或Model,再由验证器裁决,并把结果反馈给下一轮。三类对象因此可以作为同一内核的不同算子组合调度。
Data-RSI负责从运行轨迹合成经验证的数据,Harness-RSI改写System Prompt、Skill、MCP、Tools、Memory等槽位,Model-RSI则通过训练更新参数和结构。横向编排决定算子顺序,纵向优化改写算子内部规则;MetaRSI² Agent、RSI² Agent、RSI² Sub-Agent和Transition Agent共同形成三个优化层级。
小模型实验采用Qwen3.5-35B-A3B(总参数35B、激活参数3B),同时启用三类算子,并在Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond高难子集和AIME上测试。
结果显示,SWE-bench Pro解决率接近翻倍,元层机制还显著扩大了连续自我进化的累计收益。
面向Claude Opus 5、GPT-5.6 sol、Kimi K3等六款前沿模型的实验仅启用Data-RSI和Harness-RSI,在Terminal-Bench 2.1上平均提升7.3分,表明大型或闭源模型仍有可观的自我改进空间。
MetaRSI提出的五条定律指出:验证器决定改进边界;能力边界需要持续重新发现;同一能力的载体不同会带来不同成本,成熟系统应将能力迁移到更廉价的载体;可信度应由不可写面衡量;循环不会凭空创造能力,增益来自外部信息输入或既有潜力的激发。项目还开源了可持续学习和迭代的RSI-Harness,并计划将可编程仪器、自动化实验室和仿真环境接入闭环,让机器承担从假设到验证的部分工作。
本文基于公开渠道信息整理,内容可能存在不准确或遗漏之处,不代表本站立场,如内容涉及侵权或错误,请联系我们处理。
阅读原文