MetaRSI让AI学会改进“改进方法”,小模型和大模型都涨分了

3 阅读

MetaRSI:让AI学会改进“改进方法”

过去几年,AI圈流行一种叫“递归自我改进”(Recursive Self-Improvement,简称RSI)的做法:让模型自己生成训练数据、改写提示词、修复代码,甚至给自己打分。听起来很酷,但实际用起来总有点别扭——几乎所有RSI系统都依赖一套固定不变的改进程序,反复套用在同一个模型上。更麻烦的是,大家要么只搞数据增强(Data-RSI),要么只调提示工程(Harness-RSI),或者专注微调模型本身(Model-RSI),很少有人把这三条路真正打通。

文章配图

现在,由CosmosMind联合斯坦福、伯克利、清华、北大等十余家机构推出的MetaRSI-v1,试图解决这个问题。它的核心想法很简单:与其让AI一遍遍执行同样的改进流程,不如教会它如何动态调整这个流程本身。换句话说,MetaRSI不是在改进模型,而是在改进“改进模型的方法”。

文章配图

这套架构最大的突破,是提出了一个叫Loop Kernel的统一形式。它把“进步如何发生”抽象成一个与具体对象无关的闭环:系统先从运行中收集反馈信号,然后在数据、工具链(Harness)或模型参数三个维度提出改动方案,交由一个独立的验证器裁决,最后把结果回流为下一轮的学习信号。这样一来,Data-RSI、Harness-RSI和Model-RSI不再是割裂的模块,而是同一个Kernel下的不同实例化算子,可以灵活组合、统一调度。

文章配图

三个改进空间,一套底层骨架

文章配图

在Loop Kernel的基础上,MetaRSI-v1定义了三个具体的改进空间,分别对应三种算子:

文章配图

  • Data-RSI:从模型自身的执行轨迹中提取学习信号,经过校验后合成新的训练数据。这些数据不仅放大模型已有的正向能力,还能明确标定其负向边界——比如哪些问题它确实不会做。
  • Harness-RSI:针对工具链(即模型运行时的外部接口层)进行优化。MetaRSI把Harness拆成五个可插拔槽位:System Prompt、Skill、MCP(多步控制协议)、Tools和Memory。系统可以根据反馈,在这些槽位上做“加法”(新增功能)或“减法”(删掉冗余逻辑)。
  • Model-RSI:直接更新模型的参数或结构,把那些被反复验证有效的行为内化进模型内部,变成“本能”。

文章配图

值得注意的是,这三者并非孤立运作。Data-RSI产出的数据会同时供给Harness-RSI和Model-RSI使用;而这两者的改动结果又会反过来影响模型的行为轨迹,从而驱动Data-RSI重新标定能力边界。这种环环相扣的设计,让能力得以逐轮披露、累积。

文章配图

纵横双轴:让改进自己找路

光有算子还不够。MetaRSI-v1引入了纵横双轴编排机制,让系统能动态决定“下一步该改进什么”以及“怎么改进”。

  • **横轴(horizontal orchestration)**负责编排算子的应用顺序。在每个决策点,一个叫RSI² Agent的组件会根据当前的学习信号,选择下一个要执行的算子(比如先做Data-RSI再做Harness-RSI),并将其无缝接入Loop Kernel。
  • **纵轴(vertical optimization)**则深入算子内部,优化其自身的改进策略。RSI² Agent会向某个算子专属的Sub-Agent下发指令,后者根据环境反馈改写该算子的RSI规则——相当于让“改进方法”也能被改进。

为了协调这一切,整个系统由四个Agent共同运作:

  1. MetaRSI² Agent:站在最高层,学习如何优化RSI² Agent的策略选择。
  2. RSI² Agent:在每个循环节点决定是走横轴还是纵轴。
  3. RSI² Sub-Agent:负责执行纵轴指令,调整具体算子的内部逻辑。
  4. Transition Agent:衔接上下游算子的输入输出,确保产物能被正确消费。

这四个角色构成了三层改进层级:算子改进目标系统,双轴编排改进算子用法,元层改进编排策略本身。人类专家也可以随时介入任意一层,形成human-in-the-loop系统。

实验结果:小模型翻倍,大模型也涨分

MetaRSI-v1的实验分两条路线展开。

第一条面向小模型,选用了Qwen3.5-35B-A3B(总参数350亿,激活参数约30亿)。在Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond高难度子集和AIME四项严苛基准上,MetaRSI-v1让它平均提升10.9分。其中SWE-bench Pro的解决率接近翻倍——这意味着它修真实开源项目bug的能力大幅增强。更关键的是,随着自进化轮次增加,累计增益持续扩大,说明Meta层确实抬高了RSI的天花板。

第二条路线测试前沿大模型,包括GPT-5.6、Claude Opus 5、Kimi K3等六款闭源或超大规模模型。由于无法直接修改其参数,实验只启用了Data-RSI和Harness-RSI。即便如此,这些模型在Terminal-Bench 2.1上仍平均提升7.3分。这说明,即便是当前最强的AI系统,依然留有可观的自我改进空间——只要方法得当。

五条定律:给机器进步立规矩

除了技术架构,MetaRSI团队还提炼出五条关于“机器如何进步”的基本定律:

定律一:验证决定自我改进的前沿。 一个领域能不能形成自改进闭环,关键看任务能否被可靠检验。没有合适的验证器(verifier),一切改进都是空谈。

定律二:自我认知会过期。 RSI一旦改变agent的能力,它原有的系统描述就失效了。重新发现能力边界成了速率瓶颈。

定律三:能力与载体无关,但成本与载体有关。 同一项能力放在Harness里每次推理都要重付计算成本,内化进Model只需训练一次。成熟的RSI循环会持续把能力迁移到更便宜的载体。

定律四:可信度由不可写面度量。 在闭环内部,真正变强和偷偷放宽成功标准会得到完全相同的分数,且这种偏差无法从内部察觉或统计纠正。

定律五:循环不凭空创造能力。 所有增益本质上来自两部分:一是把模型已有的潜力放大固化,二是从外部引入新信息熵。自改进只是重组和激发,而非无中生有。

这些定律看似抽象,实则直指RSI实践中的痛点。比如定律四解释了为什么很多自生成数据训练后模型反而退化——因为缺乏外部锚点,系统可能在悄悄降低标准。

下一步:让科学领域拥有自己的进化闭环

MetaRSI团队没打算止步于软件层面。他们同步开源了RSI-Harness,一个能自我学习、自我迭代的工具链框架。不同科学领域或工程场景可以在使用中沉淀出可移植的“Harness Genome”——一套针对特定任务优化过的接口配置。

更远的野心在于触碰物理世界。团队设想,未来可编程仪器、自动化实验室将成为RSI的执行器和验证器。仿真、台架实验、真实仪器可以像三级火箭一样逐级推进,把昂贵且不可逆的操作放到最后。第一个在物理世界关上的进化循环,很可能不会出现在开放环境,而是诞生于高度受控的自动化实验室中。

到那时,研究者面对的将不再是零散的假设,而是一个能高速运转的“假设-验证”引擎。人类只需定义问题和价值判断,剩下的交给机器去迭代。MetaRSI的终极目标,是让AI从解题工具蜕变为文明级的进化基础设施——不是回答问题,而是不断升级“回答问题的方式”本身。