郭震 AI公众号:郭震AI

实时 AI 消息

CosmosMind联合多校发布MetaRSI-v1:统一三类RSI,并开源可自我迭代的Harness

9月14日,量子位刊载了CosmosMind团队MetaRSI-v1的发布内容:该架构由CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家海内外高校提出,被称为全球首个统一Model-RSI、Data-RSI与Harness-RSI的元递归架构,目标是改进“自我改进的过程”本身。团队同时开源了可自我学习、自我迭代的RSI-Harness,并称30亿激活参数的小模型在四项基准上平均自我提升10.9分,六款前沿模型在Terminal-Bench 2.1上平均提升7.3分。

发布时间

9月14日,量子位刊载了CosmosMind团队关于MetaRSI-v1的发布内容。这一工作由CosmosMind联合斯坦福、伯克利、MIT、清华、北大等十余家海内外高校完成,团队称其为全球首个统一Model-RSI、Data-RSI与Harness-RSI的元递归架构,核心目标是让系统能够改进“自我改进的过程”本身。论文、项目主页与开源代码随发布一并放出。

递归自我改进(Recursive Self-Improvement,RSI)指的是让模型自己生成训练数据、自己改写提示词、自己修复代码的路线。文章指出,现有RSI系统大多沿用同一种结构:一个固定不变的改进程序反复作用于模型,而且往往只从Harness、Data或Model三个视角中的一个切入,缺少可复用的统一形式化语言。

MetaRSI-v1给出的统一形式是Loop Kernel:消费反馈得到学习信号,在Data、Harness、Model三个空间上提出改动,交由验证器裁决,再把结果回流为下一轮信号。三个算子各有分工——Data-RSI从自身运行轨迹中提取学习信号,经校验后合成数据,用于标定并放大模型能力的正负边界;Harness-RSI在System Prompt、Skill、MCP、Tools、Memory五个可插拔槽位上做加法与减法;Model-RSI则更新模型自身的参数与结构,把反复验证有效的行为内化进模型。

在这套内核之上,架构安排了纵横两个方向的编排。横轴决定下一个使用哪个算子,纵轴则改写算子内部的RSI规则,由RSI² Agent向目标算子专属的Sub-Agent下发指令。整套系统由MetaRSI² Agent、RSI² Agent、RSI² Sub-Agent与Transition Agent四个Agent协调,形成算子、用法、编排策略三层改进,并且每一层都可以由人类专家局部替换,构成human-in-the-loop系统。

实验分两条路线。小模型路线使用Qwen3.5-35B-A3B(35B总参数、3B激活),完全不借助外部教师模型,在Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond高难度子集、AIME四项基准上平均自我提升10.9分,其中SWE-bench Pro的解决率接近翻倍。前沿模型路线面向Claude Opus 5、GPT-5.6 sol、Kimi K3等六款模型,因参数规模或闭源限制只启用Data与Harness两个算子,在Terminal-Bench 2.1上平均提升7.3分。

团队还从实验中提炼出五条定律:验证决定自我改进的前沿;自我认知会过期,重新发现能力边界是速率瓶颈;能力与载体无关但成本与载体有关;可信度由不可写面度量;循环不凭空创造能力,增益本质上来自外部信息熵的输入或已有能力的激发。这些定律带有规范色彩,更像团队对RSI边界条件的判断,而非已被普遍验证的结论。

需要说明的是,量子位这篇内容系获授权刊载,观点归属原作者。与论文同步,团队开源了RSI-Harness,一个可自我学习、自我迭代的Harness,并称能在使用中为不同科学与工程领域沉淀可移植的Harness Genome;项目主页在cosmosmind.ai,代码托管在GitHub的CosmosMind-ai/RSI-Harness,HuggingFace上也有对应仓库。团队称成员来自清华、北大、斯坦福等院校与头部大厂基模核心组。

真正值得关注的不是单点分数,而是“改进改进本身”这一提法能否被独立复现。RSI近来已是频繁出现的叙事——从前沿模型的自我优化传闻,到各类Harness驱动的自主科研尝试,行业对“谁来验证机器的进步”始终没有共识。MetaRSI-v1把架构与Harness一并公开,等于把可检验性交给外部;接下来要看的是第三方能否复现10.9分与7.3分的增益、这套循环在不同领域是否稳定,以及团队所设想的“自动化实验室闭环”是否真能成为物理世界里第一个合上的进化循环。

为什么重要

若其数字被独立复现,这类元层RSI架构会把自我改进从单一环节的工程技巧推向可组合、可调度的系统能力。届时“改进是否真实有效、由谁验证”会比提升幅度本身更关键。

微博邮件

CosmosMindRSIAgentOpen Source
返回实时消息

附近消息

全部

09/14 11:55

中国大模型周调用量连续二十周领跑,DeepSeek V4.1 Flash 上线三天升至第六

《每日经济新闻》基于 OpenRouter 最新数据测算,9 月 7 日至 13 日全球大模型总调用量达 127 万亿 Token,中国大模型以 61.17 万亿 Token 连续二十周位居全球首位。9 月 10 日发布的 DeepSeek V4.1 Flash 上线三天即升至第六,前五名中有四款是中国模型。

09/14 12:05

OpenAI 测试全新 ChatGPT 广告形态:点击后进入品牌对话,而不是跳转网站

Digiday 报道,OpenAI 已向部分客户推出一款面向 ChatGPT 应用的 AI 原生广告,广告主可在广告上挂载品牌 AI 智能体,用户点击“Chat to us”后不会跳转到品牌官网,而是直接进入 ChatGPT 内的品牌对话。Wayfair 正在试用,OpenAI 首席财务官 Sarah Friar 此前称现有广告只是“基础的起点”。

09/14 11:18

中国物理AI模型PhysBrain 1.5登顶全球开源榜,空间智能对标GPT-6 Astra

量子位报道称,中国团队的物理AI模型PhysBrain 1.5已登顶全球开源榜一,报道将其描述为跑完了物理闭环里最难的一段路。该模型在空间智能上的表现被拿来与GPT-6 Astra并提,物理AI方向的落地路径因此再次受到关注。

09/14 11:01

DeepSeek-V4.1-Flash 技术拆解:552B 总参数、8B 激活的 MoE 多模态模型

HackerNoon 对 DeepSeek-V4.1-Flash 的模型卡做了技术梳理:这是一款接受文本与图像输入的多模态混合专家模型,总参数 552B,单次推理只激活约 8B 参数,主打长上下文下的内存与推理效率。模型以 MIT 许可开放权重,支持 1M token 上下文与可调推理强度,但在部分推理基准上仍不及体量更大的 V4-Pro 系列。