page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

下一轮AI竞争,不只是模型更聪明,而是谁拥有更好的“评分器”

mogoec 2026-08-24 8

RSI正从黑话走进现实:AI开始进入自己的生产线

最近我越来越频繁地看到一个缩写:RSI

它的全称是 Recursive Self-Improvement,中文通常翻译成“递归自我改进”。

第一次听到这个词,很容易往科幻电影上想。

一个AI发现自己还不够聪明,于是修改自己的代码,训练出一个更聪明的自己;更聪明的版本继续修改自己,于是能力一轮一轮向上叠加,最终形成所谓的“智能爆炸”。

这确实是RSI最经典、也是最激进的想象之一。

但如果把2026年正在发生的事情放在一起看,我觉得我们反而应该把这个词从科幻里往回拉一点。

因为现实世界里的RSI,正在以一种没那么戏剧化、但可能更重要的方式出现:

AI开始进入AI自己的研发生产线。

它暂时还没有大规模自己重写自己的“大脑”,但已经开始帮忙改工具、改代码、改工作流、做实验、找算法、设计评测,甚至帮助研究下一代AI。

这是我理解当前RSI最重要的变化。


一、先说清楚:今天大家讲的RSI,其实有两个版本

RSI并不是2026年突然冒出来的新概念。

AI研究者翁荔(Lilian Weng)在2026年7月4日发布的技术文章《Harness Engineering for Self-Improvement》中,把它追溯到了数学家 I. J. Good 1965年关于“超智能机器”的讨论。后来,Eliezer Yudkowsky等人进一步讨论了“递归自我改进”这种反馈循环。

如果按照比较严格的定义,RSI应该是:

一个AI系统利用自己现有的能力,改进产生这种能力的机制,从而制造出更强的后继系统,再由更强的系统继续改进。

这可以叫“强RSI”。

比如:

AI修改训练算法;

AI重新设计自己的模型架构;

AI调整训练数据;

AI改进训练基础设施;

AI训练下一代模型;

下一代模型再接管这些工作。

这才真正形成了递归。

但现实世界还有一个更宽泛、更工程化的版本。

AI没有直接修改自己的模型权重,而是开始改进自己周围的系统:

工作流、Prompt、工具调用、上下文、记忆系统、实验流程、多智能体协作、评测器、代码库以及训练基础设施。

这可以理解成RSI的前置阶段。

我更愿意用一个比喻:

以前我们一直在升级工人,现在我们开始让工人参与升级工厂。


二、AI暂时还没有大规模改自己的“大脑”,但已经开始改自己的“工坊”

这也是我觉得翁荔那篇文章最值得注意的地方。

她用了一个现在AI工程领域越来越常见的词:

Harness。

直译有点像“马具”“控制装置”,放在AI Agent系统里,更接近于模型外面的整套运行系统。

一个大模型本身只是其中一部分。

Harness决定了模型什么时候思考、什么时候调用工具、能访问什么文件、怎样保存记忆、什么时候启动子智能体、如何检测结果以及什么时候重新尝试。

所以一个现代AI系统更接近:

基础模型 + 工作流 + 上下文 + 记忆 + 工具 + 权限 + Agent + 评测系统。

翁荔提出的现实路径并不是一上来就让模型修改自己的神经网络参数。

她认为,近期更加实际的方向之一,是:

先让AI优化Harness。

这件事情看起来没有“AI修改自己大脑”那么刺激,却非常重要。

因为很多人在使用AI的时候已经能明显感觉到:

同一个模型,装在不同系统里,能力完全不同。

给它一个聊天框,它可能只能回答问题。

给它代码仓库、终端、浏览器、测试环境、文件系统、长期记忆和多个子Agent,它就可能连续工作几个小时。

模型没有变。

生产系统变了。

所以未来AI改进AI,很可能首先发生在这里。

不是:

“我要重新训练一个更聪明的我。”

而是:

“昨天这个实验失败了,因为上下文管理不好,我把工作流改一下。”

“这个工具经常调用错误,我重新设计接口。”

“这个Agent容易漏测试,我增加回归测试。”

“这个任务最好交给另一个子Agent。”

每一次改动可能都很小。

但是下一轮AI运行在一个更好的系统里,然后又继续寻找新的改进。

递归结构就是这样一点点出现的。


三、RSI开始变得值得重视,是因为它已经不只是论文里的名词

我最近判断一个AI概念是不是开始进入现实,有一个很简单的方法:

看大公司有没有开始围绕它建团队、招人、投入算力。

RSI已经出现这种信号了。

OpenAI目前已经设立了明确以“Recursive Self-Improvement”命名的团队和招聘岗位。

其官方招聘说明写得非常直接:

RSI团队的目标,是构建能够“加速并最终执行高质量研究”的AI系统,通过自动化真实研究工作流、构建反馈循环、设计评估方式和训练模型,让OpenAI内部研究人员完成越来越复杂的研究。工作范围覆盖模型训练、评估和部署的完整生命周期。

注意这句话里的重点:

不是让AI替研究员写周报,而是让AI进入AI研究本身。

OpenAI甚至已经开始使用一组内部RSI相关评测,衡量模型在研究调试、Kernel生成等方向帮助AI研发的能力。2026年发布GPT-5.6时,OpenAI称其在这组综合RSI能力评估上较上一代提高了16.2个百分点。

无论你是否认同“RSI”这个标签,这至少说明一个事实:

AI辅助AI研发,已经成为前沿实验室独立衡量的一种能力。


四、翁荔重新回到OpenAI,也让这条路线更加值得关注

2026年7月底,《The Information》报道,翁荔在离开Thinking Machines Lab后重新加入OpenAI。

OpenAI发言人向该媒体确认了她回归的消息,而报道指出,她的新工作将涉及利用AI模型开发新的AI模型,也就是RSI相关研究。

这个时间点很有意思。

因为就在不到一个月前,翁荔刚刚发布那篇长文,系统梳理了Harness Engineering与自我改进之间的关系。

这并不能说明OpenAI未来一定会按照她博客里的路线研发,更不能理解成“OpenAI已经做出了RSI”。

但它至少告诉我们:

原来听起来非常理论化的“递归自我改进”,已经进入头部实验室真正的研究组织结构里。

Anthropic也出现了类似变化。

2026年5月19日,Andrej Karpathy加入Anthropic的预训练团队。Anthropic同时表示,他将帮助启动一个新团队,研究如何使用Claude加速预训练研究。

Anthropic在2026年4月公布的“Automated Alignment Researchers”研究里,也明确提出一个问题:

当前前沿模型已经开始参与其后继模型的开发,那么能不能同样利用模型帮助解决AI自身的对齐问题?

把这些事情放在一起,会看到一个非常清楚的变化:

以前AI实验室开发AI,是:

研究员 → AI。

现在开始逐渐变成:

研究员 + AI → 更好的AI。

如果未来AI在其中承担越来越高比例的研究任务,那么反馈循环自然就会越来越强。


五、但这里有一个非常麻烦的问题:AI怎么知道自己真的变好了?

这是我觉得RSI最容易被忽略的问题。

大家一说自我改进,很容易把注意力全部集中在“改进”两个字上。

但真正困难的问题可能是:

谁来判断这是改进?

代码相对容易。

能不能编译?

测试有没有通过?

运行速度有没有提高?

数学也相对容易。

最终答案是不是正确?

证明有没有逻辑错误?

但如果任务变成:

这篇论文有没有价值?

这个研究方向值不值得继续?

这个产品方案是不是更好?

这个企业战略是不是正确?

问题一下就复杂了。

一个AI如果不停优化某个分数,最后很可能不是越来越聪明,而是越来越擅长拿高分

这就是机器学习里非常经典的Reward Hacking问题。

你给它一个指标,它就可能把指标研究透。

最后指标越来越漂亮,真实目标却越来越差。

所以我现在越来越觉得:

RSI真正稀缺的不是生成器,而是评估器。

而剑桥大学最近的一项研究,恰好就是从这个问题切进去的。


六、剑桥的“红皇后哥德尔机”:既然选手在进化,裁判为什么不能一起进化?

2026年6月24日,来自剑桥大学、NVIDIA、Flower Labs、MBZUAI和Inria等机构的研究团队上传了一篇预印本论文:

《The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators》

即“红皇后哥德尔机”,简称RQGM。

名字来自一个很有意思的生物学比喻。

《爱丽丝镜中奇遇记》里的红皇后说过一句著名的话,大意是:

你必须拼命奔跑,才能留在原地。

进化生物学家Leigh Van Valen在1973年借用了这个比喻提出“红皇后假说”。

狐狸变快以后,兔子如果不变快,就会被吃掉。

兔子变快以后,狐狸又必须继续变快。

双方并不是朝着一个固定标准优化,而是在彼此变化的环境里不断适应。

剑桥团队把这个思想搬进了AI。

他们发现传统自我改进系统有一个结构性问题:

AI一直在进化,但考试卷没变。

刷第一次题,可以衡量能力。

刷100次以后呢?

你已经很难判断模型究竟是能力提高了,还是已经摸清了考试规律。


七、他们做了一件很关键的事:把“裁判”也放进进化回路

RQGM的思路可以简化成:

Agent进化,Evaluator也进化。

但这里马上会出现另一个问题。

如果裁判随时变化,那么昨天的80分和今天的80分根本没法比较。

所以团队没有让评分标准不停变化。

他们设计了一种“分阶段”的机制。

在一个阶段内部,Evaluator保持固定。

Agent就在这个固定标准下进行改进。

到达阶段节点以后,系统再测试有没有更好的Evaluator。

而且新的Evaluator不能自己宣布自己更优秀。

它必须接受一批拥有可信标准答案的数据测试。

只有当证据显示新Evaluator确实更加可靠时,才允许替换旧Evaluator。

更换以后,旧的评价结果也不能继续混着使用。

于是系统形成:

固定裁判 → 选手进步 → 考核新裁判 → 更换裁判 → 再继续改进。

我觉得这是这项研究真正有价值的地方。

它没有回答“AI什么时候产生超级智能”。

它回答了一个小得多、但更加现实的问题:

当AI开始改进AI时,评价AI的系统是不是也必须跟着升级?

答案至少从这些实验来看,是肯定值得研究的。


八、实验数据不错,但远远没有到“无限自我进化”

这部分特别需要把数字讲清楚。

RQGM论文报告,在代码任务上,引入共同进化的代码审查器之后,系统超过了此前基线,同时使用的搜索Token减少约1.35—1.72倍

在科学论文写作实验中,共同进化后的写作者,在由多个Agent组成的固定评审面板中,获得的接受率约为此前系统的1.78—1.86倍

在奥数证明评分任务上,共同进化的评分器,其基于真实标准答案衡量的准确率提高约9%

这些数字说明:

改进Evaluator,确实可能让自我改进循环继续向前推进。

但是如果只讲这些数字,就容易把研究写成“AI已经可以不停进化”。

事实并不是这样。

在奥数证明任务上,剑桥团队自己公布的结果就很有代表性。

最好的RQGM证明系统平均得分达到4.33,高于一个自我改进基线的3.73;Pass@6达到61.7%,也高于后者的51.7%。

但如果看最严格的满分指标Pass@7,一个由人类专家大量设计规则的Static ImoCode系统是55.0%,最好的RQGM只有48.3%

也就是说:

AI把自己的改进循环往前推了一步,但人类精心设计的系统依然可以在重要指标上领先。

而且论文目前仍是预印本。

研究团队也明确强调,这些是相对短程的实验,更长时间、更大规模的递归搜索最终会发生什么,还需要进一步研究。

这才是目前比较准确的状态。


九、Google的AlphaEvolve走了另一条路:AI开始优化制造AI的基础设施

如果说RQGM在改“质检体系”,那么Google DeepMind的AlphaEvolve更像是在改“生产设备”。

AlphaEvolve并不是传统意义上的强RSI。

它使用Gemini模型生成候选程序,再通过自动化Evaluator运行、验证和打分,然后利用进化算法继续搜索更优程序。

基础Gemini模型本身并没有在这个过程中不断重写自己的权重。

但有趣的地方在于:

AlphaEvolve找到的算法,后来确实被用于优化AI自己的基础设施和训练过程。

Google DeepMind公布的数据非常具体。

AlphaEvolve找到的一种数据中心调度算法已经投入Google生产环境,平均可以持续释放约0.7%的全球计算资源

它还优化了Gemini架构中的一个关键矩阵运算Kernel,使该运算速度提高23%,最终让Gemini训练时间降低约1%

另外,它针对Transformer使用的FlashAttention Kernel实现,取得过最高32.5%的加速

到了2026年,DeepMind又公布AlphaEvolve已经从试验系统逐渐进入Google核心计算基础设施,并被用于下一代TPU设计、缓存策略、数据库和其他优化工作。

这就形成了一个非常有意思的环:

Gemini产生算法方案;

AlphaEvolve筛选和进化方案;

方案优化AI芯片和训练系统;

更好的基础设施再训练未来的AI。

它还不是严格意义上的自主RSI。

但机器已经进入“制造下一代机器”的生产线上了。

这就是为什么我觉得现在谈RSI,已经不能简单当成科幻黑话。


十、真正限制RSI的,可能不是AI够不够聪明,而是“什么叫更好”

把翁荔、OpenAI、Anthropic、剑桥和DeepMind这些不同路线放在一起,我看到了一条很明显的共同线索:

生成已经越来越便宜。

AI可以一次产生100个算法。

可以生成1000段代码。

可以同时启动几十个Agent。

可以跑大量实验。

真正麻烦的是:

哪一个值得留下?

如果判断标准非常明确,自我改进就容易发生。

代码就是典型例子。

程序跑快20%,并且所有测试都通过,很容易判断它是不是更好。

芯片设计、数学搜索和部分工程优化也是如此。

AlphaEvolve为什么能够取得进展?

一个重要原因就是这些领域存在自动、客观、可量化的Evaluator

DeepMind自己也特别强调,AlphaEvolve最适合那些解决方案能够被系统性、自动化验证的问题。

但很多现实世界的问题根本没有这样的评分器。

哪个公司未来更有潜力?

什么研究值得投入五年?

一个产品到底是在增加用户价值,还是只是在提高点击率?

什么才叫一篇真正重要的论文?

什么样的组织结构长期最有效?

这些问题甚至人类之间都没有标准答案。

所以RSI越往后走,一个有点反直觉的结果可能越明显:

未来最值钱的不一定是“让AI生成更多”,而是建立一个AI无法轻易欺骗的评价体系。


十一、这也是为什么我认为“Evaluator”会成为AI时代一个越来越重要的资产

过去两年,我们经常听到一个词:

Prompt。

再往后可能会变成:

Agent。

但如果AI继续进入真实工作流,我认为另一个词会越来越重要:

Evaluator。

也就是:

到底怎么判断AI有没有把事情做好?

实际上,OpenAI当前的RSI招聘说明中,就直接把“设计评估方法”以及对“研究判断、假设生成与测试、长周期实验执行”的评测列为核心工作。

原因很好理解。

没有Evaluator,就没有稳定反馈。

没有稳定反馈,就没有自动优化。

没有自动优化,就不存在真正意义上的递归改进。

所以从工程角度看,一个自我改进系统至少需要形成这样的闭环:

提出方案 → 执行 → 测量结果 → 判断优劣 → 保留改进 → 下一轮继续。

今天的大模型已经非常擅长第一步。

Agent正在解决第二步。

而第三、第四步,可能才是接下来几年最大的战场。


十二、所以普通人到底该怎样理解RSI?

我觉得不用去预测“AI什么时候觉醒”。

那个问题离绝大多数人的现实工作太远。

一个更加实际的问题是:

我今天做的工作,有多少能够形成AI未来可以使用的反馈?

比如你是销售。

不要只留下:

“这个客户成交了。”

最好留下:

客户最初为什么犹豫?

哪句话改变了他的判断?

什么条件真正推动成交?

哪些客户虽然成交,但最终续费很差?

你是在积累销售数据,同时也是在积累Evaluator。

如果你做内容。

不要只记录:

阅读量10万。

还可以记录:

用户读完了吗?

有没有收藏?

有没有搜索进入?

三个月以后这篇内容还会不会有人看?

有没有被别的网站或者AI系统引用?

这也是评价体系。

如果你做产品。

不要只让AI自动生成100个需求。

真正重要的是积累:

什么需求最终产生长期留存?

哪些改动提高短期点击却伤害长期体验?

哪些实验失败了?

失败原因是什么?

什么情况下应该停止一个项目?

这些判断一旦结构化下来,未来就可能成为AI自动改进工作流的重要数据。


十三、AI时代真正稀缺的东西,可能正在变化

以前一个公司的核心资产通常是:

人、资金、技术和数据。

Agent时代以后,我觉得还要再增加一种:

评价能力。

你到底知不知道什么是好?

这件事以前没有那么显眼。

因为人类员工会在大量隐性经验中完成评价。

一个资深编辑扫一眼就知道文章哪里不对。

一个优秀工程师看日志就知道问题可能出现在哪里。

一个经验丰富的销售聊十分钟,就知道客户是真有需求还是礼貌性咨询。

这些东西以前藏在人脑里。

但如果未来要让AI不断改进工作,那么这些隐性标准必须被逐渐显性化。

否则AI只会不停生产。

不会真正进步。

从这个角度再看RSI,我觉得它带来的最大变化可能不是“机器突然变得无法控制”。

至少现阶段不是。

更现实的变化是:

越来越多工作会从“人做、AI辅助”,转向“AI做、人定义目标和评价标准”。

而再往后一步:

AI开始参与修改自己的工作流,人类负责守住评价边界。


十四、这也是RSI目前最值得观察的地方

截至2026年8月,如果让我给RSI的现实状态下一句话定义,我会这样说:

我们还没有看到能够自主、稳定、无限递归提升自身通用智能的AI,但已经看到AI越来越深地进入AI研发、评测、算法优化和基础设施改进的反馈循环。

两件事情不能混为一谈。

前者仍然是一个巨大的科学与安全问题。

后者已经开始发生。

Anthropic甚至在其2026年的Frontier Safety Roadmap中提出,他们认为最早到2027年,AI系统就存在“大幅加速甚至完全自动化顶级研究团队部分工作的可能性”,其中明确包含AI研发本身。当然,这属于Anthropic自己的前瞻判断,并不是已经发生的事实。

所以我现在再看到RSI,已经不会首先想到“AI觉醒”。

我想到的反而是一座越来越自动化的工厂。

以前人类站在里面制造AI。

后来AI走进工厂,开始给人类研究员写代码、跑实验。

再后来,它开始调整流水线、优化工具、修改算法、检查结果。

而现在,一些实验正在尝试连质检员也一起升级。

这座工厂离完全自主运行还有很远。

但AI已经不只是工厂生产出来的产品。

它正在变成这座工厂的一部分。

而对我们普通人来说,真正值得提前准备的,也许不是如何和一个“超级智能”竞争。

而是三个更加现实的问题:

我要解决的到底是什么问题?

什么证据能够证明事情做得更好了?

如果AI按照这个标准不断优化,最终跑偏了,谁有能力发现,又由谁负责?

如果未来很多工作真的会形成自己的“小型RSI循环”,那么一个人的价值,可能越来越不只是亲手完成多少任务。

还有一个能力会越来越重要:

能不能定义一个值得优化的目标,并设计一把不会轻易骗人的尺子。

这可能才是RSI从黑话走向现实之后,对大多数人真正有意义的地方。


关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

参考资料

  1. Lilian Weng,《Harness Engineering for Self-Improvement》,2026年7月4日。 系统讨论Harness Engineering、自动研究、自我改进Agent和RSI之间的关系。
  2. OpenAI,RSI团队招聘信息。 官方将Recursive Self-Improvement作为独立研究方向,目标包括自动化真实研究工作流、设计反馈循环与研究评估。
  3. The Information,2026年7月29日。 报道OpenAI确认Lilian Weng重新加入公司,并参与使用AI开发AI模型的RSI相关研究。
  4. Iacob等,《The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators》,arXiv,2026年6月24日。 目前属于预印本研究,实验结果不应解读为已实现无限递归自我改进。
  5. University of Cambridge Department of Computer Science and Technology,2026年7月。 对RQGM机制、研究限制及实验结果进行了官方介绍。
  6. Google DeepMind,AlphaEvolve。 2025年公布AlphaEvolve及其在数据中心、TPU和Gemini训练中的应用,2026年继续公布其规模化部署情况。
  7. Anthropic,Automated Alignment Researchers,2026年4月。 讨论利用AI模型协助下一代AI及AI对齐研究。
  8. Anthropic Frontier Safety Roadmap,2026年更新。 关于自动化R&D时间线属于Anthropic的风险预测与规划,不应当作已经实现的能力。

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部