VC追着投的RSI究竟是什么?姚顺宇、施天麟与清华/上交的教授们给出了回答
文|王欣逸
编辑|张雨忻
RSI(递归式自我改进)的热度骤然飙升。
周六,在上海西岸,一大群顶尖的思考者聚集在一起,同时还有那些试图赋予AI类似智慧能力的人。
在太平洋对岸,数月未公开露面、声称Gemini 3.8 Flash是“RSI的一大步”的姚顺宇,正在电话那头等待;成立仅半年、估值达46.5亿美元、押注AI自我进化的硅谷初创公司Recursive Superintelligence,其联合创始人施天麟,也加入了这场对话。
他们围绕一个共同的问题而来:资本大量涌入的RSI赛道,究竟在发生什么?
RSI,即Recursive Self-Improvement,自今年年中以来成为最热门的话题。它指的是AI能够自我改进,从编写代码、运行实验,到调整架构、优化权重,甚至自主设定新目标。
现场绝大多数是研究员,来自各大企业、高校和实验室,也有不少知名投资机构、FA和孵化器。我们全程参与了这场长达五小时的活动,一些设想和争议在会场反复出现。
人们正在设想一个人类无需介入的终局——人类不必参与模型自我改进的循环,同时探讨大厂、实验室和初创公司如何探索并实现这一目标。
不同的声音也在浮现:自我进化是否是一个悲观的未来?最终会被模型厂商吞噬?RSI不做预训练,不应该是一个垂直模型……
关于如何定义、评估和验证RSI,以及它将在何时实现等问题,我们整理了姚顺宇、施天麟等硅谷研究员,以及来自清华、上交等高校的助理教授和研究员的观点,供参考:
- 当AI公司扩大自身规模(如模型能力、客户规模等)时,不再需要扩大团队规模,RSI就会发生。
- RSI不是一个单一事件,而是一个连续事件。
- 从今年年初的一些迹象看,RSI是可以实现的。主要原因是Coding和Agent Model都已成熟,达到突破点。按照Coding Agent的方式,可以让AI训练AI,实现AI自己的想法并改进自身,包括架构、数据集及其训练方法,从而推动RSI的实现。
- RSI与模型在自己生成数据上的微调,很难说清两者的区别是定性的还是定量的。某种意义上,模型自己生成数据是RSI的婴儿形态。
- 数据与环境是RSI落地的好生意。
- 与OpenAI、Anthropic等大厂竞争,创业者的机会不在通用智能,而在基础知识之外的专业知识。
- 不需要从头训练RSI模型,其基础性能难以超过通用大模型,也难以自我迭代出更强能力。
- 评估智能,应关注它是如何学会这一能力,而非学会了什么。
- 验证的终极形态不应依赖人工,但短期内必须保留人参与,特别是在任务定义和质量把控上,仍需人类专家做出高质量测评。
- RSI的最终版可能是一个能自我改进的模型;但在初步阶段,可依靠外部辅助模型和收集反馈信号。
- 人们想象的RSI可能是其终局——整个循环完全不需要人。但从实际看,我们是否会走到那一天,以及是否有必要追求到那一步,还不确定。
以下是这场由AGI House、红杉中国、Research AI+合办的主题为“当AI开始递归自我改进”活动的部分干货内容,经过摘编:
在此之前,先介绍几位嘉宾——
- 姚顺宇:Google DeepMind主任资深科学家,专注Auto-Research方向探索,博士毕业于斯坦福大学理论物理专业,此前任职于Anthropic。
- 施天麟:Recursive Superintelligence联合创始人,清华姚班校友,曾在OpenAI担任研究员,在斯坦福大学读博期间退学联合创办过AI公司Cresta。
- 谷雨:NeoCognition联合创始人,ApprenticeBench一作。
- 周煊赫:上海交通大学助理教授,Theseus Labs创始人。
- 孟繁青:Evolvent AI联合创始人,RSI Bench Data一作。
- 刘子鸣:清华大学助理教授,元环智能创始人,专注AI for AI方向。
- 穆尧:上海交通大学助理教授,SeeAct AI创始人,做具身智能的RSI方向。
此外,其他嘉宾还包括海内外高校、实验室的研究员和博士生。值得一提的是,主办方AGI House活跃于硅谷,是一个AI创业社区与孵化器,这也是他们首次在国内举办活动。
那么,切入正题。
如何递归?如何改进?
Q:如何定义RSI?
姚顺宇:RSI可能不是一件事,而是一个连续事件。我们现在只能讨论我们在这一连续事件上的位置。
举个简单例子,模型从几年前就可以自己写代码了,这加速了研究闭环,也算RSI发生了一部分;后来模型可以主动监控实验进程并提出新实验,这也算RSI。
从效果看,人们想象的RSI可能是其终局——整个循环不需要任何人。但我们是否会走到那一天,以及是否有必要追求到那一步,还不确定。
施天麟:从RSI角度看,模型本身必须对自己约束情况有觉察。它要知道自己在哪些方面不足,并在出现偏离时能自行纠正。这是RSI本身、模型自我强化的一个重要能力。
当然,光模型本身不够,还需通过一定harness和应用场景来约束模型。
谷雨:RSI是一个很大的课题,我们今天在场的几个人做的事可能完全不同。
大家的共性可能有以下三类:一是AI自己找到提升目标;二是AI不断让自己更接近目标,这可能是迭代过程;三是目标背后对应的是很长久任务。 例如,让大模型做大模型,目标可能是更好的模型,其中AI需自己建立预算、规划模型、总结方法,最终得到更新模型。
孟繁青:我们现在常把Self-improving、持续学习、RSI几个词放在一起说。
从我的角度看,RSI是在给定环境、奖励或奖励函数的情况下,模型在其中持续迭代某个东西。这个东西可以是架构、权重等,最终目标是获得更高奖励得分。
在真正意义上的RSI中,模型需优化自己、提升表现,而非优化某个产物或另一个模型。整个系统没有除了自己以外的外部因素,只有自己、环境和奖励。
周煊赫:从计算机角度,Recursive这个词应递归到最本质层面。对AI系统,最本质层面是参数和架构设计;再往外是Harness中的代码和脚本;再往外是交互环境,如各种文件、工作区。
我们对RSI的定义,是先切入产业场景,看当前工作流是否有痛点。发现痛点后,再检索解决方案。
RSI的最终版可能是一个能自我改进的模型;但在初步阶段,可依靠外部辅助模型和收集反馈信号。
RSI真的实现自我进化了吗?
Q:如何评估RSI真的实现了自我改进?在场的各位也有一些关于Benchmark的工作,请分享你们的评估方式。
谷雨:评估主要关注什么,以及为何在这个时间点重要,有两个关注点:
一是生态效度,在Benchmark上做得好不一定直接意味着能解决问题,对应实际生产或经济价值。我们想验证的是让通用大模型变成能在岗位上执行的成熟员工。因此要搭建贴近真实工作的环境。
二是,我们到底要评估智能的什么?我在很多场合引用过观点,智能指的不是你会多少东西,而是你怎么学会这些的。
周煊赫:评估很重要,特别是华人做AI,定方向后大家会快速把天花板卷起来。
现在的问题是,Benchmark本身不够好,哪怕知名Benchmark也有很多错题。面向RSI的Benchmark应长什么样?除了传统Agent的reasoning、exploration和planning这三个能力,我们还需思考RSI需要什么新能力。我们也相信,未来不只需要AI自己迭代,真正高质量的Benchmark还需结合人力专家。
验证,是RSI持续演进的卡点
Q:如何定义验证?请分享你们的思考。
姚顺宇:关于RSI最难实现的是自我改进,还是证明自己真改进了?我觉得是验证自己真正改进了。
过去很多人做过类似事,当时叫“赛博批评”——一个AI出题、一个AI解题。这最容易掉进局部最优:比如一个AI总出简单题,另一个都能答对;或总出难题,另一个永远答不上。最难的地方在于,模型得能真正理解自己进步到什么程度。相比解决问题,RSI里最难的事还是定义问题。
孟繁青:先不谈验证设计得对不对,就算全正确,也会带来大问题:可复现性。
现在环境越来越复杂,涉及CPU型号、操作系统、内存大小等,不同物理平台会导致差距。
此外,大多数Benchmark每题给0到1的绝对分数,但这些分数没有强物理意义,绝对分数本身也说明不了什么。
我们公司的一位合作者提出了另一套评分标准:将层级分为Agent-SOTA、Human-SOTA等不同layer,每层对应不同Artifact。在新平台上,通过跑这些Artifact确定模型输出属于哪一层,避免物理意义和硬件差距问题。
周煊赫:我很早前看过清华一个团队的工作,他们在推理过程中通过给权重加扰动噪声,验证不同扰动方式,能让模型推得更好。这实现了我们追求的:边推理、边学习、边调整权重的能力。
从内部看,我们现在已设计推理和记忆分离的模块,从记忆埋点模块有隐式中间态传递,也可通过外部手段保护。
和大厂抢生态位的RSI初创们
Q:如何思考RSI创业公司和模型厂商的边界?哪些地方模型厂商有绝对优势,哪些地方创业公司能做出不同?
孟繁青:RSI概念很大,科研机构、创业公司、大厂做的都是不同部分,从上到下是这样的:
最上游,如Alphabet、OpenAI或Kimi等公司,他们说的RSI基本上是纯粹RSI,即模型迭代自身,包括架构,追求更高智能。
再往下一层,如传统SaaS公司,RSI需要环境和验证。对他们来说,能否将原本生态抽象出一套Agent-native服务,方便上游模型厂商通过Agent调用并提升Agent在该场景下的智力,这就是这些下游公司理解的RSI。
再往下,一些初创公司的方向可能是:不纯粹用RSI迭代基础模型本身,不花大价钱训自己的基础模型,而是用RSI迭代某些产物,如Harness。
对上游和初创公司,目标明确:要么提升模型本身,要么提升下游表现;对底层SaaS公司,他们对RSI的态度可能是:能否提供更多环境。
周煊赫:尽管大家对数据要求越来越高,我认为现在的数据和环境仍是一门好生意。
在一艘到处漏水的船上,靠手堵窟窿解决。大厂手再多也顾不过来。所以当模型落到千行百业时,需一套自进化范式,其核心要素是数据和环境。
数据侧,对预算不足的小公司,他们需要轻量化数据方案,再转化为用户资产。
环境侧,在嘈杂环境执行任务,再好的Agent也会大幅降分。如何理解并让这套方案和模型协同进化,非常重要。
谷雨:可从两个角度:一是创业公司服务模型厂,二是创业公司做的事与模型厂互补。
关于服务模型厂,如周老师提到的卖数据、卖环境,都是好生意。
关于互补,繁青老师提到模型厂提供通用智力。我认为大部分创业者不应和大厂拼通用智能,而应做通用智力之后的专门知识。
一些争议
Q:目前行业关于RSI的讨论,哪些观点和定义是你们不认可或不理解的?
谷雨:我不太理解为什么国内投资人给RSI投了这么多钱?
刘子鸣:自进化是一个非常悲观的未来。
上一次自进化是从灵长类到人,这很漫长。尽管AI有大量进展,但自进化是低效路线,意味着被卡在低维。
打个比方,现在大模型是银河系,我们在里面,觉得银河系是全部。但如果顺着大模型路径外拓,会发现外面是虚空。只有先熵增,上升到宇宙维度,再做熵减,才可能发现别处有适合人类居住的星系。
分久必合,合久必分。我们现在处于合阶段,只用一个模型解决所有问题,但边界已暴露,需为不同领域设计不同模型。
孟繁青:有些人在做RSI的模型,我不太能理解这个词。
比如某个模型能完成垂域任务,这只是把RSI概念包到垂域模型上;又比如强调做模型的方法是RSI,这也不是真正RSI,因为现在模型厂的后训练已高度自动化,RSI能力在训练时已被内化。
假设常规训练出一个模型,它在环境里反复迭代、提高奖励反馈,学习曲线会呈现“得分随训练时间上升”的斜率。RSI模型的价值在于这个斜率会更高。这一模型不应针对某个垂域调出,而应具有通用性。
周煊赫:关于做RSI的预训练模型,我非常不相信。
我们相信的RSI路径是:一种是大厂在做的,堆算力、找数据、构建超大图谱、出难题训练自己;另一种是,当AI进入千行百业时,由于大厂也缺失环境数据,通用模型在这类场景的解决能力受限,因此还需另一套RSI范式。
下一个突破
Q:你最期待的RSI范式突破是什么?或未来什么潜在范式突破会对你们做的事造成颠覆?
孟繁青:我比较期待看RSI如何改进Infra层。Infra原本面向人类用户设计,之后会不会衍生出更面向Agent的方法?比如原本的SaaS已积极改进,但更底层的东西,如各种训练infra,之后会不会出现纯智能类Agent介入?
谷雨:我关注实验学习能力,尤其是在真实环境中的实验学习。我们公司正在做的事是:把一个Agent放进真实公司后,如何让它自己摸清公司规则和工作流。
我们公司现在押注的路线是对比非参数和参数化两种形式。
非参数路线,如上下文、记忆路线,好处是不需动模型权重,也不需很多样本;坏处是不够鲁棒,因为更新记忆文档的优化算法不稳定,压缩和表达能力不够强。参数化路线表达力高、压缩率高,但需很多训练样本。
所以我们认为未来方向是:通过非参数形式在线学到新知识,再让基座模型生成更多数据,或把这些知识压进参数里。
周煊赫:我们相信,RSI会内生在模型本身能力上。之前提到的与生态环境不匹配的问题,本质是模型能力不够强。如果未来模型能力上去,可能自己就会把RSI跑闭环,具体需几方面能力:
第一,主动感知环境的能力。 模型能主动、流式、低成本地输入环境里各种模态数据,感知哪些与任务对齐,做模态消歧。进一步,它甚至可以改造环境、适应环境。
第二,探索和创新能力。 它不应被限制在人类偏好对齐上,而能自主探索出领导力、品味甚至关键信息感知能力。
第三,在线持续学习能力。 一定不能只有后训练模式,反向传播的显存开销远大于推理显存开销。如何做出轻量化、小样本的持续学习也很关键。这一能力与安全密切相关,因此AI还需满足对自己能力边界的可控和感知能力。
欢迎关注~
欢迎交流~
本文来自微信公众号,作者:王欣逸,36氪经授权发布。